<?xml version="1.0" encoding="UTF-8"?><!DOCTYPE article  PUBLIC "-//NLM//DTD Journal Publishing DTD v3.0 20080202//EN" "http://dtd.nlm.nih.gov/publishing/3.0/journalpublishing3.dtd"><article xmlns:mml="http://www.w3.org/1998/Math/MathML" xmlns:xlink="http://www.w3.org/1999/xlink" dtd-version="3.0" xml:lang="en" article-type="research article"><front><journal-meta><journal-id journal-id-type="publisher-id">JCC</journal-id><journal-title-group><journal-title>Journal of Computer and Communications</journal-title></journal-title-group><issn pub-type="epub">2327-5219</issn><publisher><publisher-name>Scientific Research Publishing</publisher-name></publisher></journal-meta><article-meta><article-id pub-id-type="doi">10.4236/jcc.2016.415004</article-id><article-id pub-id-type="publisher-id">JCC-72314</article-id><article-categories><subj-group subj-group-type="heading"><subject>Articles</subject></subj-group><subj-group subj-group-type="Discipline-v2"><subject>Computer Science&amp;Communications</subject></subj-group></article-categories><title-group><article-title>
 
 
  A GASVM Algorithm for Predicting Protein Structure Classes
 
</article-title></title-group><contrib-group><contrib contrib-type="author" xlink:type="simple"><name name-style="western"><surname>Longlong</surname><given-names>Liu</given-names></name><xref ref-type="aff" rid="aff1"><sup>1</sup></xref></contrib><contrib contrib-type="author" xlink:type="simple"><name name-style="western"><surname>Mingjiao</surname><given-names>Ma</given-names></name><xref ref-type="aff" rid="aff1"><sup>1</sup></xref></contrib><contrib contrib-type="author" xlink:type="simple"><name name-style="western"><surname>Tingting</surname><given-names>Zhao</given-names></name><xref ref-type="aff" rid="aff1"><sup>1</sup></xref></contrib></contrib-group><aff id="aff1"><addr-line>Department of Mathematical Sciences, Ocean University of China, Qingdao, China</addr-line></aff><pub-date pub-type="epub"><day>28</day><month>11</month><year>2016</year></pub-date><volume>04</volume><issue>15</issue><fpage>46</fpage><lpage>53</lpage><history><date date-type="received"><day>September</day>	<month>26,</month>	<year>2016</year></date><date date-type="rev-recd"><day>Accepted:</day>	<month>November</month>	<year>25,</year>	</date><date date-type="accepted"><day>November</day>	<month>28,</month>	<year>2016</year></date></history><permissions><copyright-statement>&#169; Copyright  2014 by authors and Scientific Research Publishing Inc. </copyright-statement><copyright-year>2014</copyright-year><license><license-p>This work is licensed under the Creative Commons Attribution International License (CC BY). http://creativecommons.org/licenses/by/4.0/</license-p></license></permissions><abstract><p>
 
 
   
   The research methods of protein structure prediction mainly focus on finding effective features of protein sequences and developing suitable machine learning algorithms. But few people consider the importance of weights of features in classification. We propose the GASVM algorithm (classification accuracy of support vector machine is regarded as the fitness value of genetic algorithm) to optimize the coefficients of these 16 features (5 features are proposed first time) in the classification, and further develop a new feature vector. Finally, based on the new feature vector, this paper uses support vector machine and 10-fold cross-validation to classify the protein structure of 3 low similarity datasets (25PDB, 1189, FC699). Experimental results show that the overall classification accuracy of the new method is better than other methods. 
  
 
</p></abstract><kwd-group><kwd>Protein Structural Classes</kwd><kwd> Protein Secondary Structure</kwd><kwd> Genetic Algorithm</kwd><kwd>  Support Vector Machine</kwd></kwd-group></article-meta></front><body><sec id="s1"><title>1. Introduction</title><p>For today’s advances in bioinformatics, one of the main tasks is the prediction of protein structure in post-genome era of genomic research [<xref ref-type="bibr" rid="scirp.72314-ref1">1</xref>]. Improving the classification accuracy of the spatial structure of proteins not only helps to understand protein function but also helps to understand how proteins perform biological functions [<xref ref-type="bibr" rid="scirp.72314-ref2">2</xref>]. Depending on the difference of secondary structure alignment and topology fragment in protein sequence, Levitt and Chothia divided a protein sequence into four structural classes: all-<inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x2.png" xlink:type="simple"/></inline-formula>, all-<inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x3.png" xlink:type="simple"/></inline-formula>, <inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x4.png" xlink:type="simple"/></inline-formula> and <inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x5.png" xlink:type="simple"/></inline-formula> [<xref ref-type="bibr" rid="scirp.72314-ref3">3</xref>]. The current classification prediction algorithms are mostly concentrated on these four structural classes prediction.</p><p>Current methods for protein structure prediction are mainly focus on finding effective features of protein sequences and developing suitable machine learning algorithms. The former kind of research is mostly based on the amino acid composition [<xref ref-type="bibr" rid="scirp.72314-ref4">4</xref>] and pseudo-amino acid composition [<xref ref-type="bibr" rid="scirp.72314-ref5">5</xref>], which considered that similar sequences have similar protein structures. But the prediction results are easily affected by the sequence similarity. For example, the prediction accuracy of a high similarity dataset is 95% while the prediction accuracy of a low similarity dataset may be only 40% - 60%. Because the relationship between protein structures is most associated with protein secondary structure, someone proposed methods based on protein secondary structure and protein functional domain to predict protein structure [<xref ref-type="bibr" rid="scirp.72314-ref6">6</xref>]. Experiments show that for low similarity datasets this method also has a high prediction accuracy. After extracting effective features, you can use a variety of classification algorithms to classify the extracted feature vector, such as Neural networks [<xref ref-type="bibr" rid="scirp.72314-ref7">7</xref>], Support vector machines [<xref ref-type="bibr" rid="scirp.72314-ref8">8</xref>], Bayesian classification [<xref ref-type="bibr" rid="scirp.72314-ref9">9</xref>], rough set theory [<xref ref-type="bibr" rid="scirp.72314-ref10">10</xref>], Fuzzy classification [<xref ref-type="bibr" rid="scirp.72314-ref11">11</xref>], Logit Boost classifier [<xref ref-type="bibr" rid="scirp.72314-ref12">12</xref>], Information about the differences method [<xref ref-type="bibr" rid="scirp.72314-ref13">13</xref>], etc. Thus, an appropriate machine learning algorithm is very important to the prediction.</p></sec><sec id="s2"><title>2. Materials and Methods</title><p>In this section, first, give the methods for extracting 16 features from the protein secondary structure to compose a 16-dimensional feature vector; second, change every protein sequence of 3 low similarity datasets (25PDB, 1189 and FC699 dataset) to a 16-dimensional feature vector; finally, classify the 16-dimensional feature vectors by GASVM algorithm.</p><sec id="s2_1"><title>2.1. Materials</title><p>To evaluate the proposed method and facilitate its comparison with other existing methods, 3 widely used benchmark datasets 25PDB [<xref ref-type="bibr" rid="scirp.72314-ref13">13</xref>], 1189 [<xref ref-type="bibr" rid="scirp.72314-ref9">9</xref>] and FC699 [<xref ref-type="bibr" rid="scirp.72314-ref16">16</xref>] with sequence similarity lower than 25%, 40% and 40% respectively were selected. The compositions of 3 datasets were shown in <xref ref-type="table" rid="table1">Table 1</xref>.</p></sec><sec id="s2_2"><title>2.2. 16-Dimensional Feature Vector</title><p>Through PSIPRED [<xref ref-type="bibr" rid="scirp.72314-ref14">14</xref>] software, each amino acid residue of protein sequences can be mapped to one kind of the following three secondary structural elements: H (Helix), E (Strand), and C (Coil). In this paper, let SSS denote secondary structure sequence and</p><table-wrap id="table1" ><label><xref ref-type="table" rid="table1">Table 1</xref></label><caption><title> Compositions of 3 datasets</title></caption><table><tbody><thead><tr><th align="center" valign="middle"  rowspan="2"  >Dataset</th><th align="center" valign="middle"  colspan="5"  >Number</th></tr></thead><tr><td align="center" valign="middle" >all-<inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x6.png" xlink:type="simple"/></inline-formula></td><td align="center" valign="middle" >all-<inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x7.png" xlink:type="simple"/></inline-formula></td><td align="center" valign="middle" ><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x8.png" xlink:type="simple"/></inline-formula></td><td align="center" valign="middle" ><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x9.png" xlink:type="simple"/></inline-formula></td><td align="center" valign="middle" >Total</td></tr><tr><td align="center" valign="middle" >25PDB</td><td align="center" valign="middle" >443</td><td align="center" valign="middle" >443</td><td align="center" valign="middle" >346</td><td align="center" valign="middle" >441</td><td align="center" valign="middle" >1673</td></tr><tr><td align="center" valign="middle" >1189</td><td align="center" valign="middle" >223</td><td align="center" valign="middle" >294</td><td align="center" valign="middle" >334</td><td align="center" valign="middle" >241</td><td align="center" valign="middle" >1092</td></tr><tr><td align="center" valign="middle" >FC699</td><td align="center" valign="middle" >130</td><td align="center" valign="middle" >269</td><td align="center" valign="middle" >377</td><td align="center" valign="middle" >82</td><td align="center" valign="middle" >858</td></tr></tbody></table></table-wrap><p>no-C-SSS denote the sequence that was removed coil structure from secondary structure sequence. Let <inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x10.png" xlink:type="simple"/></inline-formula> and <inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x11.png" xlink:type="simple"/></inline-formula> denote the length of SSS and the length of no-C-SSS respectively. For convenience, the 16-dimensional feature vector which is extracted from protein secondary structure is denoted by<inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x12.png" xlink:type="simple"/></inline-formula>. The method to extract the feature vector will be described in more detail.</p><p>1) The first two features represent the proportion of H and E in SSS respectively, which have been proved significantly helpful in improving accuracy of protein structural classes[<xref ref-type="bibr" rid="scirp.72314-ref15">15</xref>], The features are as follows:</p><disp-formula id="scirp.72314-formula13"><graphic  xlink:href="http://html.scirp.org/file/72314x13.png"  xlink:type="simple"/></disp-formula><p>where <inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x14.png" xlink:type="simple"/></inline-formula> is the number of <inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x15.png" xlink:type="simple"/></inline-formula> in the SSS respectively. Since <inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x16.png" xlink:type="simple"/></inline-formula> (where <inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x17.png" xlink:type="simple"/></inline-formula> is the number of <inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x18.png" xlink:type="simple"/></inline-formula> in the SSS), we only need to extract <inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x19.png" xlink:type="simple"/></inline-formula> two features to represent the SSS.</p><p>2) To classify the protein structures, the maximum length and the average length of <inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x20.png" xlink:type="simple"/></inline-formula> and <inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x21.png" xlink:type="simple"/></inline-formula> segments (the successive same letter) are also important factors. Six features are described as follows:</p><disp-formula id="scirp.72314-formula14"><graphic  xlink:href="http://html.scirp.org/file/72314x22.png"  xlink:type="simple"/></disp-formula><p>The<inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x23.png" xlink:type="simple"/></inline-formula>, <inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x23.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x24.png" xlink:type="simple"/></inline-formula>and <inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x23.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x24.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x25.png" xlink:type="simple"/></inline-formula> are the maximum length of segment and <inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x23.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x24.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x25.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x26.png" xlink:type="simple"/></inline-formula> and <inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x23.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x24.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x25.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x26.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x27.png" xlink:type="simple"/></inline-formula> in SSS respectively.</p><p>3) The more segments whose length reaches a certain value, the more likely to determine the structure of a protein. We respectively selected the segment <inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x28.png" xlink:type="simple"/></inline-formula> whose length is greater than 5 and the segment <inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x28.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x29.png" xlink:type="simple"/></inline-formula> whose length is greater than 3 as features of protein secondary structure [<xref ref-type="bibr" rid="scirp.72314-ref20">20</xref>]. In order to represent the structure more accurately, we also extracted segments position information in SSS. That can be defined as follows:</p><disp-formula id="scirp.72314-formula15"><graphic  xlink:href="http://html.scirp.org/file/72314x30.png"  xlink:type="simple"/></disp-formula><p>where, <inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x31.png" xlink:type="simple"/></inline-formula>is the number of segment<inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x31.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x32.png" xlink:type="simple"/></inline-formula>, <inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x31.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x32.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x33.png" xlink:type="simple"/></inline-formula>is the number of segment<inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x31.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x32.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x33.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x34.png" xlink:type="simple"/></inline-formula>, <inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x31.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x32.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x33.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x34.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x35.png" xlink:type="simple"/></inline-formula>is the position of <inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x31.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x32.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x33.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x34.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x35.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x36.png" xlink:type="simple"/></inline-formula> <inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x31.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x32.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x33.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x34.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x35.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x36.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x37.png" xlink:type="simple"/></inline-formula> in the protein secondary structure sequence.</p><p>4) While proteins in the <inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x38.png" xlink:type="simple"/></inline-formula> and <inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x38.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x39.png" xlink:type="simple"/></inline-formula> classes contain both <inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x38.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x39.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x40.png" xlink:type="simple"/></inline-formula>-helices and <inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x38.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x39.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x40.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x41.png" xlink:type="simple"/></inline-formula>-strands, there is a decided difference in the distribution of them. <inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x38.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x39.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x40.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x41.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x42.png" xlink:type="simple"/></inline-formula>-helices and <inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x38.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x39.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x40.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x41.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x42.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x43.png" xlink:type="simple"/></inline-formula>-strands are usually separated in the <inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x38.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x39.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x40.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x41.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x42.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x43.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x44.png" xlink:type="simple"/></inline-formula> class, but are usually interspersed in the <inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x38.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x39.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x40.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x41.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x42.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x43.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x44.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x45.png" xlink:type="simple"/></inline-formula> class [<xref ref-type="bibr" rid="scirp.72314-ref20">20</xref>]. Therefore, it is necessary to extract features from the no-C- SSS. In this paper we extract 5 features from no-C-SSS that only have H and E segments first time. The features are defined as follows:</p><disp-formula id="scirp.72314-formula16"><graphic  xlink:href="http://html.scirp.org/file/72314x46.png"  xlink:type="simple"/></disp-formula><p><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x47.png" xlink:type="simple"/></inline-formula>is the number of two adjacent <inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x47.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x48.png" xlink:type="simple"/></inline-formula> segments in no-C-SSS, <inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x47.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x48.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x49.png" xlink:type="simple"/></inline-formula>is the number of <inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x47.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x48.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x49.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x50.png" xlink:type="simple"/></inline-formula>segment-<inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x47.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x48.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x49.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x50.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x51.png" xlink:type="simple"/></inline-formula> segment, <inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x47.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x48.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x49.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x50.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x51.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x52.png" xlink:type="simple"/></inline-formula>is the number of <inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x47.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x48.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x49.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x50.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x51.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x52.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x53.png" xlink:type="simple"/></inline-formula> segment-<inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x47.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x48.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x49.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x50.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x51.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x52.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x53.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x54.png" xlink:type="simple"/></inline-formula> segment, <inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x47.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x48.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x49.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x50.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x51.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x52.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x53.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x54.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x55.png" xlink:type="simple"/></inline-formula>is the number of <inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x47.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x48.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x49.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x50.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x51.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x52.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x53.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x54.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x55.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x56.png" xlink:type="simple"/></inline-formula> segment-<inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x47.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x48.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x49.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x50.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x51.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x52.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x53.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x54.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x55.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x56.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x57.png" xlink:type="simple"/></inline-formula> segment-<inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x47.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x48.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x49.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x50.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x51.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x52.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x53.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x54.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x55.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x56.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x57.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x58.png" xlink:type="simple"/></inline-formula> segment, <inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x47.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x48.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x49.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x50.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x51.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x52.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x53.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x54.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x55.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x56.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x57.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x58.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x59.png" xlink:type="simple"/></inline-formula>is the number of <inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x47.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x48.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x49.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x50.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x51.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x52.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x53.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x54.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x55.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x56.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x57.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x58.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x59.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x60.png" xlink:type="simple"/></inline-formula> segment-<inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x47.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x48.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x49.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x50.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x51.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x52.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x53.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x54.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x55.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x56.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x57.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x58.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x59.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x60.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x61.png" xlink:type="simple"/></inline-formula> segment-<inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x47.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x48.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x49.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x50.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x51.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x52.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x53.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x54.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x55.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x56.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x57.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x58.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x59.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x60.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x61.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x62.png" xlink:type="simple"/></inline-formula> segment-<inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x47.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x48.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x49.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x50.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x51.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x52.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x53.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x54.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x55.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x56.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x57.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x58.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x59.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x60.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x61.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x62.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x63.png" xlink:type="simple"/></inline-formula> segment.</p></sec><sec id="s2_3"><title>2.3. Construction of Classification Algorithm</title><sec id="s2_3_1"><title>2.3.1. Support Vector Machine</title><p>There are many algorithms to solve the protein multi-classification problem, such as neural net-work classification, support vector machine (SVM), Bayesian classification and so on. In this paper, support vector machine is selected for protein classification. The basic idea of SVM is map the data to a high dimensional space, and then find the data partition hyper plane in the high dimensional space. SVM has been widely used in protein secondary structure classification for its high prediction accuracy [<xref ref-type="bibr" rid="scirp.72314-ref17">17</xref>]. In this paper, we use “one-to-one” multi-classification method, and then combine 6 two-clas- sifiers to achieve multi-classification. Compared with other kernel function, the radial basis kernel function is better when deal with nonlinear problem [<xref ref-type="bibr" rid="scirp.72314-ref18">18</xref>]. So we select the radial basis kernel function <inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x64.png" xlink:type="simple"/></inline-formula> as kernel function.</p></sec><sec id="s2_3_2"><title>2.3.2. GASVM Algorithm</title><p>Genetic algorithm (GA) is a method based on the principle of natural selection and genetic optimization search. It includes several steps, such as chromosome coding, population initialization, fitness function calculating, basic genetic operation and so on. Here, GASVM algorithm is proposed to optimize the coefficients of these 16 features in the classification. The classification accuracy of SVM is regarded as the fitness function value of GASVM algorithm. The steps of GASVM algorithm are described as follows:</p><p>1) Let the coefficient vector be<inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x65.png" xlink:type="simple"/></inline-formula>. Randomly generate 16 initial coefficients between [0,1] and code every chromosome with binary coding respectively. Then 200 chromosomes initialized compose the initial population.</p><p>2) The new feature vector <inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x66.png" xlink:type="simple"/></inline-formula> is the dot product of coefficient vector <inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x66.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x67.png" xlink:type="simple"/></inline-formula> and feature vector<inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x66.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x67.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x68.png" xlink:type="simple"/></inline-formula>.</p><p>3) Calculate the new feature vector <inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x69.png" xlink:type="simple"/></inline-formula> of each protein sequence. Classify the feature vectors by SVM of 2.3.1, The bigger fitness value of the corresponding chromosome is in the algorithm, the greater the probability of chromosome survival is. To improve the classification accuracy, the classification accuracy of SVM is regarded as the fitness function value.</p><p>4) The first 160 individuals with big fitness function values are selected as parents in the next generation. In order to obtain the global optimum solution and improve the convergence rate, sorting selection method is adopted, the top 80% chromosomes with higher fitness from population are selected and copied into the mating pool.</p><p>5) A new generation is produced by the genetic and crossover operation of paternal generation chromosomes. The multi-point crossover is adopted.</p><p>6) In the new generation, 40 population samples are selected randomly, and then mutation is performed. It means the values of certain genes of a chromosome are replaced with other values to generate a new individual. Here, 5% of the chromosomes are mutated by point mutation method.</p><p>7) Repeat steps (2) to (6) until the fitness function values satisfy the requirement or the maximum number of cycles is reached.</p></sec></sec></sec><sec id="s3"><title>3. Results and Discussion</title><p>The protein sequences in 25PDB, 1189, FC699 3 datasets were classified by GASVM algorithm and 10-fold cross-validation was used. The classification accuracy can be seen in <xref ref-type="table" rid="table2">Table 2</xref>, the overall accuracy of the 25PDB, 1189, FC699 dataset is 83.32%, 85.44% and 93.36% respectively, the accuracy of all-<inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x70.png" xlink:type="simple"/></inline-formula>, all-<inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x70.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x71.png" xlink:type="simple"/></inline-formula>, <inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x70.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x71.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x72.png" xlink:type="simple"/></inline-formula> and <inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x70.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x71.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x72.png" xlink:type="simple"/></inline-formula><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x73.png" xlink:type="simple"/></inline-formula> bigger than 92.35%, 86.69%, 81.02% and 73.33% respectively. <xref ref-type="fig" rid="fig1">Figure 1</xref> shows the optimal coefficients, the differences among 16 coefficients are obvious.</p><table-wrap id="table2" ><label><xref ref-type="table" rid="table2">Table 2</xref></label><caption><title> The results for the 3 datasets with 10-fold cross-validation</title></caption><table><tbody><thead><tr><th align="center" valign="middle"  rowspan="2"  >Dataset</th><th align="center" valign="middle"  colspan="5"  >Accuracy (%)</th></tr></thead><tr><td align="center" valign="middle" >all-<inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x74.png" xlink:type="simple"/></inline-formula></td><td align="center" valign="middle" >all-<inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x75.png" xlink:type="simple"/></inline-formula></td><td align="center" valign="middle" ><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x76.png" xlink:type="simple"/></inline-formula></td><td align="center" valign="middle" ><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x77.png" xlink:type="simple"/></inline-formula></td><td align="center" valign="middle" >Total</td></tr><tr><td align="center" valign="middle" >25PDB</td><td align="center" valign="middle" >93.23</td><td align="center" valign="middle" >82.17</td><td align="center" valign="middle" >81.02</td><td align="center" valign="middle" >74.38</td><td align="center" valign="middle" >83.32</td></tr><tr><td align="center" valign="middle" >1189</td><td align="center" valign="middle" >92.35</td><td align="center" valign="middle" >86.69</td><td align="center" valign="middle" >87.11</td><td align="center" valign="middle" >75.12</td><td align="center" valign="middle" >85.44</td></tr><tr><td align="center" valign="middle" >FC699</td><td align="center" valign="middle" >96.92</td><td align="center" valign="middle" >92.19</td><td align="center" valign="middle" >97.36</td><td align="center" valign="middle" >73.33</td><td align="center" valign="middle" >93.36</td></tr></tbody></table></table-wrap><fig id="fig1"  position="float"><label><xref ref-type="fig" rid="fig1">Figure 1</xref></label><caption><title> The optimal coefficients of 3 datasets</title></caption><graphic mimetype="image"   position="float"  xlink:type="simple"  xlink:href="http://html.scirp.org/file/72314x78.png"/></fig></sec><sec id="s4"><title>4. Comparison with Other Methods</title><p>The SCPRED, MODAS and RKS-PPSC methods are widely accepted in protein structure classification and the 25PDB, 1189, FC699 3 datasets are adopted to validate the effects. Here, the results of GASVM algorithm were compared with SCPRED, MODAS, RKS-PPSC and reference [<xref ref-type="bibr" rid="scirp.72314-ref20">20</xref>] (see <xref ref-type="table" rid="table3">Table 3</xref>). The data in <xref ref-type="table" rid="table3">Table 3</xref> show that the overall accuracies obtained by our method are higher than other methods on 25PDB, 1189 and FC699 datasets, which increase 0.42%, 1.90% and 1.59% respectively.</p><p>Our method obtains the highest prediction accuracies for the classes among all the tested methods on 3 datasets. As for the class, the accuracy is 83.53% on 25PDB dataset and 86.69% on 1189 dataset, which is 0.17% and 0.41% lower than that of the famous MODAS method [<xref ref-type="bibr" rid="scirp.72314-ref21">21</xref>] respectively, but is 3.43% higher than SCPRED [<xref ref-type="bibr" rid="scirp.72314-ref17">17</xref>] and 2.29% higher than kongs’ method [<xref ref-type="bibr" rid="scirp.72314-ref20">20</xref>]. About the class, the accuracy is 81.02% on 25PDB dataset, which is 4.78% lower than that of the RKS-PPSC [<xref ref-type="bibr" rid="scirp.72314-ref22">22</xref>], but is 7.02% higher than SCPRED [<xref ref-type="bibr" rid="scirp.72314-ref17">17</xref>]; the accuracy is 87.11% on 1189dataset, which is 2.49% lower than SCPRED, but is 4.51% higher than RKS-PPSC. It is also noticed that the significant improvement is made in particular for the class, which is the difficult class to predict.</p></sec><sec id="s5"><title>5. Conclusion</title><p>In the paper, the importance of the weights of different features in protein structure classification are considered, so GASVM algorithm is proposed to optimize the coeffi-</p><table-wrap id="table3" ><label><xref ref-type="table" rid="table3">Table 3</xref></label><caption><title> The comparison of different methods</title></caption><table><tbody><thead><tr><th align="center" valign="middle"  rowspan="2"  >Dataset</th><th align="center" valign="middle"  rowspan="2"  >Method</th><th align="center" valign="middle"  rowspan="2"  >Reference</th><th align="center" valign="middle"  colspan="5"  >Accuracy (%)</th></tr></thead><tr><td align="center" valign="middle" >all-<inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x79.png" xlink:type="simple"/></inline-formula></td><td align="center" valign="middle" >all-<inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x80.png" xlink:type="simple"/></inline-formula></td><td align="center" valign="middle" ><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x81.png" xlink:type="simple"/></inline-formula></td><td align="center" valign="middle" ><inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/72314x82.png" xlink:type="simple"/></inline-formula></td><td align="center" valign="middle" >Total</td></tr><tr><td align="center" valign="middle" >25PDB</td><td align="center" valign="middle" >SCPRED</td><td align="center" valign="middle" >[<xref ref-type="bibr" rid="scirp.72314-ref17">17</xref>]</td><td align="center" valign="middle" >92.6</td><td align="center" valign="middle" >80.1</td><td align="center" valign="middle" >74.0</td><td align="center" valign="middle" >71.0</td><td align="center" valign="middle" >79.7</td></tr><tr><td align="center" valign="middle" ></td><td align="center" valign="middle" >MODAS</td><td align="center" valign="middle" >[<xref ref-type="bibr" rid="scirp.72314-ref21">21</xref>]</td><td align="center" valign="middle" >92.30</td><td align="center" valign="middle" >83.70</td><td align="center" valign="middle" >81.20</td><td align="center" valign="middle" >68.30</td><td align="center" valign="middle" >81.40</td></tr><tr><td align="center" valign="middle" ></td><td align="center" valign="middle" >RKS-PPSC</td><td align="center" valign="middle" >[<xref ref-type="bibr" rid="scirp.72314-ref22">22</xref>]</td><td align="center" valign="middle" >92.80</td><td align="center" valign="middle" >83.30</td><td align="center" valign="middle" >85.80</td><td align="center" valign="middle" >70.10</td><td align="center" valign="middle" >82.90</td></tr><tr><td align="center" valign="middle" ></td><td align="center" valign="middle" >Kong et al.</td><td align="center" valign="middle" >[<xref ref-type="bibr" rid="scirp.72314-ref20">20</xref>]</td><td align="center" valign="middle" >-</td><td align="center" valign="middle" >-</td><td align="center" valign="middle" >-</td><td align="center" valign="middle" >-</td><td align="center" valign="middle" >-</td></tr><tr><td align="center" valign="middle" ></td><td align="center" valign="middle" >GASVM</td><td align="center" valign="middle" >Our method</td><td align="center" valign="middle" >93.69</td><td align="center" valign="middle" >83.53</td><td align="center" valign="middle" >81.02</td><td align="center" valign="middle" >75.08</td><td align="center" valign="middle" >83.32</td></tr><tr><td align="center" valign="middle" >1189</td><td align="center" valign="middle" >SCPRED</td><td align="center" valign="middle" >[<xref ref-type="bibr" rid="scirp.72314-ref17">17</xref>]</td><td align="center" valign="middle" >89.1</td><td align="center" valign="middle" >86.7</td><td align="center" valign="middle" >89.6</td><td align="center" valign="middle" >53.8</td><td align="center" valign="middle" >80.6</td></tr><tr><td align="center" valign="middle" ></td><td align="center" valign="middle" >MODAS</td><td align="center" valign="middle" >[<xref ref-type="bibr" rid="scirp.72314-ref21">21</xref>]</td><td align="center" valign="middle" >92.3</td><td align="center" valign="middle" >87.10</td><td align="center" valign="middle" >87.90</td><td align="center" valign="middle" >65.40</td><td align="center" valign="middle" >83.50</td></tr><tr><td align="center" valign="middle" ></td><td align="center" valign="middle" >RKS-PPSC</td><td align="center" valign="middle" >[<xref ref-type="bibr" rid="scirp.72314-ref22">22</xref>]</td><td align="center" valign="middle" >89.2</td><td align="center" valign="middle" >86.7</td><td align="center" valign="middle" >82.6</td><td align="center" valign="middle" >65.6</td><td align="center" valign="middle" >81.3</td></tr><tr><td align="center" valign="middle" ></td><td align="center" valign="middle" >Kong et al.</td><td align="center" valign="middle" >[<xref ref-type="bibr" rid="scirp.72314-ref20">20</xref>]</td><td align="center" valign="middle" >91.9</td><td align="center" valign="middle" >84.4</td><td align="center" valign="middle" >85.3</td><td align="center" valign="middle" >72.2</td><td align="center" valign="middle" >83.5</td></tr><tr><td align="center" valign="middle" ></td><td align="center" valign="middle" >GASVM</td><td align="center" valign="middle" >Our method</td><td align="center" valign="middle" >92.35</td><td align="center" valign="middle" >86.69</td><td align="center" valign="middle" >87.11</td><td align="center" valign="middle" >75.12</td><td align="center" valign="middle" >85.44</td></tr><tr><td align="center" valign="middle" >FC699</td><td align="center" valign="middle" >SCPRED</td><td align="center" valign="middle" >[<xref ref-type="bibr" rid="scirp.72314-ref17">17</xref>]</td><td align="center" valign="middle" >-</td><td align="center" valign="middle" >-</td><td align="center" valign="middle" >-</td><td align="center" valign="middle" >-</td><td align="center" valign="middle" >87.5</td></tr><tr><td align="center" valign="middle" ></td><td align="center" valign="middle" >MODAS</td><td align="center" valign="middle" >[<xref ref-type="bibr" rid="scirp.72314-ref21">21</xref>]</td><td align="center" valign="middle" >-</td><td align="center" valign="middle" >-</td><td align="center" valign="middle" >-</td><td align="center" valign="middle" >-</td><td align="center" valign="middle" >-</td></tr><tr><td align="center" valign="middle" ></td><td align="center" valign="middle" >RKS-PPSC</td><td align="center" valign="middle" >[<xref ref-type="bibr" rid="scirp.72314-ref22">22</xref>]</td><td align="center" valign="middle" >-</td><td align="center" valign="middle" >-</td><td align="center" valign="middle" >-</td><td align="center" valign="middle" >-</td><td align="center" valign="middle" >-</td></tr><tr><td align="center" valign="middle" ></td><td align="center" valign="middle" >Kong et al.</td><td align="center" valign="middle" >[<xref ref-type="bibr" rid="scirp.72314-ref20">20</xref>]</td><td align="center" valign="middle" >96.2</td><td align="center" valign="middle" >90.7</td><td align="center" valign="middle" >96.3</td><td align="center" valign="middle" >69.5</td><td align="center" valign="middle" >92.0</td></tr><tr><td align="center" valign="middle" ></td><td align="center" valign="middle" >GASVM</td><td align="center" valign="middle" >Our method</td><td align="center" valign="middle" >96.92</td><td align="center" valign="middle" >92.19</td><td align="center" valign="middle" >97.36</td><td align="center" valign="middle" >73.33</td><td align="center" valign="middle" >93.36</td></tr></tbody></table></table-wrap><p>cients of these 16 features in the classification. Finally, 10-fold cross-validation is used to classify the protein structures of3 low similarity datasets (25PDB, 1189, FC699) and experimental results show that the overall classification accuracy of the new method is better than other methods. GASVM algorithm is very effective in protein structure classification. Weights of different features are considered is very necessary.</p></sec><sec id="s6"><title>Acknowledgements</title><p>The authors would like to thank all of the researchers who made publicly available data used in this study and thank the National Natural Science Foundation of China (No: 61303145) for the support to this work.</p></sec><sec id="s7"><title>Cite this paper</title><p>Liu, L.L., Ma, M.J. and Zhao, T.T. (2016) A GASVM Algorithm for Predicting Protein Structure Classes. Journal of Computer and Communications, 4, 46-53. http://dx.doi.org/10.4236/jcc.2016.415004</p></sec></body><back><ref-list><title>References</title><ref id="scirp.72314-ref1"><label>1</label><mixed-citation publication-type="other" xlink:type="simple">Black, D.L. (2000) Protein Diversity from Alternative Splicing: A Challenge for Bioinformatics and Post-Genome Biology. Cell, 103, 367-370.  
http://dx.doi.org/10.1016/S0092-8674(00)00128-8</mixed-citation></ref><ref id="scirp.72314-ref2"><label>2</label><mixed-citation publication-type="other" xlink:type="simple">Anfinsen, C.B. (1973) Principles That Govern the Folding of Protein Chains. Science, 181, 223-230. http://dx.doi.org/10.1126/science.181.4096.223</mixed-citation></ref><ref id="scirp.72314-ref3"><label>3</label><mixed-citation publication-type="other" xlink:type="simple">Levitt, M. and Chothia, C. (1976) Structural Pattern in Globular Proteins. Nature, 261, 552-558. http://dx.doi.org/10.1038/261552a0</mixed-citation></ref><ref id="scirp.72314-ref4"><label>4</label><mixed-citation publication-type="other" xlink:type="simple">Chou, K.C. (1999) A Key Driving Force in Determination of Protein Structural Classes. Biochemical &amp; Biophysical Research Communications, 264, 216-224.  
http://dx.doi.org/10.1006/bbrc.1999.1325</mixed-citation></ref><ref id="scirp.72314-ref5"><label>5</label><mixed-citation publication-type="other" xlink:type="simple">Chou, K.C. (2011) Some Remarks on Protein Attribute Prediction and Pseudo Amino Acid Composition. Journal of Theoretical Biology, 273, 236-247.  
http://dx.doi.org/10.1016/j.jtbi.2010.12.024</mixed-citation></ref><ref id="scirp.72314-ref6"><label>6</label><mixed-citation publication-type="other" xlink:type="simple">Chou, K.C. (2004) Structural Bioinformatics and Its Impact to Biomedical Science. Current Medicinal Chemistry, 11, 2105-2134. http://dx.doi.org/10.2174/0929867043364667</mixed-citation></ref><ref id="scirp.72314-ref7"><label>7</label><mixed-citation publication-type="other" xlink:type="simple">Volpato, V., Adelfio, A. and Pollastri, G. (2013) Accurate Prediction of Protein Enzymatic Class by n-to-1 Neural Networks. Bmc Bioinformatics, 14, 1-7.  
http://dx.doi.org/10.1186/1471-2105-14-s1-s11</mixed-citation></ref><ref id="scirp.72314-ref8"><label>8</label><mixed-citation publication-type="other" xlink:type="simple">Chen, Y.K. and Li, K.B. (2013) Predicting Membrane Protein Types by Incorporating Protein Topology, Domains, Signal Peptides, and Physicochemical Properties into the General form of Chou’s Pseudo Amino Acid Compo-sition. Journal of Theoretical Biology, 318, 1-12. http://dx.doi.org/10.1016/j.jtbi.2012.10.033</mixed-citation></ref><ref id="scirp.72314-ref9"><label>9</label><mixed-citation publication-type="other" xlink:type="simple">Wang, Z. and Zheng, Y. (2000) How Good Is Prediction of Protein Structural Class by the Component-Coupled Method? Proteins Structure Function &amp; Bioinformatics, 38, 165-175.  
http://dx.doi.org/10.1002/(SICI)1097-0134(20000201)38:2&lt;165::AID-PROT5&gt;3.0.CO;2-V</mixed-citation></ref><ref id="scirp.72314-ref10"><label>10</label><mixed-citation publication-type="other" xlink:type="simple">Cao, Y., Liu, S., Zhang, L., Qin, J., Wang, J. and Tang, K. (2005) Prediction of Protein Structural Class with Rough Sets. Bmc Bioinformatics, 7, 1-6.</mixed-citation></ref><ref id="scirp.72314-ref11"><label>11</label><mixed-citation publication-type="other" xlink:type="simple">Shen, H.B., Yang, J., Liu, X.J. and Chou, K.C. (2005) Using Supervised Fuzzy Clustering to Predict Protein Structural Classes. Biochemical &amp; Biophysical Research Communications, 334, 577-581. http://dx.doi.org/10.1016/j.bbrc.2005.06.128</mixed-citation></ref><ref id="scirp.72314-ref12"><label>12</label><mixed-citation publication-type="other" xlink:type="simple">Cai, Y.D., Feng, K.Y., Lu, W.C. and Chou, K.C. (2006) Using LogitBoost Classifier to Predict Protein Structural Classes. Journal of Theoretical Biology, 238, 172-176.  
http://dx.doi.org/10.1016/j.jtbi.2005.05.034</mixed-citation></ref><ref id="scirp.72314-ref13"><label>13</label><mixed-citation publication-type="other" xlink:type="simple">Jin, L., Fang, W. and Tang, H. (2003) Prediction of Protein Structural Classes by a New Measure of Information Discrepancy. Computational Biology &amp; Chemistry, 27, 373-380.  
http://dx.doi.org/10.1016/S1476-9271(02)00087-7</mixed-citation></ref><ref id="scirp.72314-ref14"><label>14</label><mixed-citation publication-type="other" xlink:type="simple">Jones, D.T. (1999) Protein Secondary Structure Prediction Based on Position-Specific Scoring Matrices. Journal of Molecular Biology, 292, 195-202.  
http://dx.doi.org/10.1006/jmbi.1999.3091</mixed-citation></ref><ref id="scirp.72314-ref15"><label>15</label><mixed-citation publication-type="other" xlink:type="simple">Anand, A., Pugalenthi, G. and Suganthan, P.N. (2008) Predicting Protein Structural Class by SVM with Class-Wise Optimized Features and Decision Probabilities. Journal of Theoretical Biology, 253, 375-80. http://dx.doi.org/10.1016/j.jtbi.2008.02.031</mixed-citation></ref><ref id="scirp.72314-ref16"><label>16</label><mixed-citation publication-type="other" xlink:type="simple">Altschul, S.F., Madden, T.L., Sch&amp;aumlffer, A.A., Zhang, J., Zhang, Z., Miller, W. and Lipman, D.J. (1997) Gapped Blast and Psi-Blast: A New Generation of Protein Database Search Programs. Nucleic Acids Research, 25, 3389-3402. http://dx.doi.org/10.1093/nar/25.17.3389</mixed-citation></ref><ref id="scirp.72314-ref17"><label>17</label><mixed-citation publication-type="other" xlink:type="simple">Kurgan, L., Cios, K. and Chen, K. (2008) Scpred: Accurate Prediction of Protein Structural Class for Sequences of Twilight-Zone Similarity with Predicting Sequences. BMC Bioinformatics, 9, 815-818. http://dx.doi.org/10.1186/1471-2105-9-226</mixed-citation></ref><ref id="scirp.72314-ref18"><label>18</label><mixed-citation publication-type="other" xlink:type="simple">Zhang, S., Ding, S. and Wang, T. (2011) High-Accuracy Prediction of Protein Structural Class for Low-Similarity Sequences Based on Predicted Secondary Structure. Biochimie, 93, 710-714. http://dx.doi.org/10.1016/j.biochi.2011.01.001</mixed-citation></ref><ref id="scirp.72314-ref19"><label>19</label><mixed-citation publication-type="other" xlink:type="simple">Liu, T. and Jia, C. (2010) A High-Accuracy Protein Structural Class Prediction Algorithm Using Predicted Secondary Structural Information. Journal of Theoretical Biology, 267, 272-275. http://dx.doi.org/10.1016/j.jtbi.2010.09.007</mixed-citation></ref><ref id="scirp.72314-ref20"><label>20</label><mixed-citation publication-type="other" xlink:type="simple">Liang, K., Zhang, L. and Lv, J. (2014) Accurate Prediction of Protein Structural Classes by Incorporating Predicted Secondary Structure Information into the General Form of Chou’s Pseudo Amino Acid Composition. Journal of Theoretical Biology, 344, 12-18.  
http://dx.doi.org/10.1016/j.jtbi.2013.11.021</mixed-citation></ref><ref id="scirp.72314-ref21"><label>21</label><mixed-citation publication-type="other" xlink:type="simple">Mizianty, M.J. and Lukasz, K. (2009) Modular Prediction of Protein Structural Classes from Sequences of Twilight-Zone Identity with Predicting Sequences. BMC Bioinformatics, 10, 1-24. http://dx.doi.org/10.1186/1471-2105-10-414</mixed-citation></ref><ref id="scirp.72314-ref22"><label>22</label><mixed-citation publication-type="other" xlink:type="simple">Yang, J.Y., Peng, Z.L. and Xin, C. (2010) Prediction of Protein Structural Classes for Low- Homology Sequences Based on Predicted Secondary Structure. BMC Bioinformatics, 11, 1-10. http://dx.doi.org/10.1186/1471-2105-11-s1-s9</mixed-citation></ref></ref-list></back></article>