<?xml version="1.0" encoding="UTF-8"?><!DOCTYPE article  PUBLIC "-//NLM//DTD Journal Publishing DTD v3.0 20080202//EN" "http://dtd.nlm.nih.gov/publishing/3.0/journalpublishing3.dtd"><article xmlns:mml="http://www.w3.org/1998/Math/MathML" xmlns:xlink="http://www.w3.org/1999/xlink" dtd-version="3.0" xml:lang="en" article-type="research article"><front><journal-meta><journal-id journal-id-type="publisher-id">JBiSE</journal-id><journal-title-group><journal-title>Journal of Biomedical Science and Engineering</journal-title></journal-title-group><issn pub-type="epub">1937-6871</issn><publisher><publisher-name>Scientific Research Publishing</publisher-name></publisher></journal-meta><article-meta><article-id pub-id-type="doi">10.4236/jbise.2017.105B004</article-id><article-id pub-id-type="publisher-id">JBiSE-76090</article-id><article-categories><subj-group subj-group-type="heading"><subject>Articles</subject></subj-group><subj-group subj-group-type="Discipline-v2"><subject>Biomedical&amp;Life Sciences</subject></subj-group></article-categories><title-group><article-title>
 
 
  Cancer Specific Non-Synonymous Single Nucleotide Polymorphism Prediction in the Context of Haplotype and Protein Interacting Sites
 
</article-title></title-group><contrib-group><contrib contrib-type="author" xlink:type="simple"><name name-style="western"><surname>Pakeeza</surname><given-names>Akram</given-names></name><xref ref-type="aff" rid="aff1"><sup>1</sup></xref></contrib><contrib contrib-type="author" xlink:type="simple"><name name-style="western"><surname>Liao</surname><given-names>Li</given-names></name><xref ref-type="aff" rid="aff1"><sup>1</sup></xref></contrib></contrib-group><aff id="aff1"><addr-line>Computer and Information Sciences, University of Delaware, Newark, Delaware, USA</addr-line></aff><pub-date pub-type="epub"><day>10</day><month>05</month><year>2017</year></pub-date><volume>10</volume><issue>05</issue><fpage>28</fpage><lpage>44</lpage><history><date date-type="received"><day>January</day>	<month>8,</month>	<year>2017</year></date><date date-type="rev-recd"><day>Accepted:</day>	<month>May</month>	<year>3,</year>	</date><date date-type="accepted"><day>May</day>	<month>10,</month>	<year>2017</year></date></history><permissions><copyright-statement>&#169; Copyright  2014 by authors and Scientific Research Publishing Inc. </copyright-statement><copyright-year>2014</copyright-year><license><license-p>This work is licensed under the Creative Commons Attribution International License (CC BY). http://creativecommons.org/licenses/by/4.0/</license-p></license></permissions><abstract><p>
 
 
   
   In this work, we study predicting the effect of non-synonymous SNPs on several cancers. We trained classifiers on both sequential and structural features extracted from the affected genes and assessed the predictions made by the trained classifiers using cross validation. Specifically, we investigated how the prediction performance can be improved by connecting SNPs in the context of haplotype and interacting sites of proteins encoded by affected genes. We found that accuracy was consistently enhanced by combining sequential and structural features, with increase ranging from a few percentage points up to more than 20 percentage points. The results for putting SNPs in the context of interacting sites were less consistent. Compared to individual SNPs, these that appear together in haplotype showed stronger correlation with one another and with the phenotype, and therefore led to significant improvement inprediction performance, with ROC score increased from 0.81 to 0.95. Although some similar effect has been expected for connecting SNPs to interacting sites in proteins, the performance actually got worse. This decrease in prediction accuracy may be caused by the small data set being used in the study, as many affected proteins in the study do not have known interacting sites. 
  
 
</p></abstract><kwd-group><kwd>Single Nucleotide Polymorphism</kwd><kwd> Haplotype</kwd><kwd> Interaction Sites</kwd><kwd> Prediction</kwd><kwd> Cancer</kwd></kwd-group></article-meta></front><body><sec id="s1"><title>1. Introduction</title><p>It has been widely accepted that genetic variations can be associated with diseases. Missense non-synonymous single nucleotide polymorphism (nsSNP) is considered as one of the most common type of variation [<xref ref-type="bibr" rid="scirp.76090-ref1">1</xref>]. Missense nsSNP is a variation in which an amino acid in the protein sequence is changed due to a single point mutation. Because of the association between genetic variations and diseases, there has been active research to identify SNPs and to determine their phenotypic effects, with some reported success in finding the variants as causes to diagnose, treat and prevent complex diseases [<xref ref-type="bibr" rid="scirp.76090-ref1">1</xref>].</p><p>Understanding how these nsSNPs affect protein function remains a critical task. Protein-Protein interaction sites have been considered as a hotspot for nsSNP associated with diseases [<xref ref-type="bibr" rid="scirp.76090-ref2">2</xref>]. In order to unveil genetic variations and functional effect on a protein, multiple methods have been developed, such as enzyme activity prediction [<xref ref-type="bibr" rid="scirp.76090-ref3">3</xref>] [<xref ref-type="bibr" rid="scirp.76090-ref4">4</xref>], detection of disease potential of a SNP [<xref ref-type="bibr" rid="scirp.76090-ref5">5</xref>]. And recently, the computational alanine scanning method is developed to study SNPs effect on protein-protein interaction, essentially by replacing every single residue with alanine tosee the effect on protein by estimating free energy change between the wild and the mutated one [<xref ref-type="bibr" rid="scirp.76090-ref6">6</xref>] [<xref ref-type="bibr" rid="scirp.76090-ref7">7</xref>] [<xref ref-type="bibr" rid="scirp.76090-ref8">8</xref>] [<xref ref-type="bibr" rid="scirp.76090-ref9">9</xref>] [<xref ref-type="bibr" rid="scirp.76090-ref10">10</xref>]. Another recent work has been done for disease associated nsSNPs on protein-protein interactions by investigating the change in binding energy using force field and electrostatic calculation [<xref ref-type="bibr" rid="scirp.76090-ref11">11</xref>].</p><p>While most methods have primarily focused on either using sequence based properties such as conservation score alone like SIFT [<xref ref-type="bibr" rid="scirp.76090-ref12">12</xref>] or using only structure based properties such as PoPMuSiC [<xref ref-type="bibr" rid="scirp.76090-ref13">13</xref>], recently there are attempts at hybrid approaches for SNP prediction, such as Polyphen 2, which have showed promising prediction results as compared to using sole properties of structure or sequence [<xref ref-type="bibr" rid="scirp.76090-ref14">14</xref>]. It has also been reported that individual SNPs and haplotypes have different effect on the protein function [<xref ref-type="bibr" rid="scirp.76090-ref15">15</xref>]. In certain cases, it has been found that, with the presence of two SNPs, the disease-causing SNP becomes recessive and does not exert effect on protein function [<xref ref-type="bibr" rid="scirp.76090-ref15">15</xref>]. Despite of the pro- gress, accurate prediction of effect of nsSNP on PPI leading to specific diseases remains a major challenge.</p><p>In this paper, we study predicting the effect of non-synonymous SNPs on several cancers, acute myeloid leukemia, breast cancer, colorectal cancer, and esophageal cancer, particularly in the context of haplotype and interaction sites. We formalize the prediction of SNP effects on diseases as a classification problem and then apply machine learning techniques, including support vector machines (SVM) and random forest (RF), to learn from training examples and to classify unseen SNPs. Our comprehensive comparative analysis of different classifiers using a set of evaluation metrics explores not only the utility of various machine learning methods for this problem but also whether and how prediction of SNP’s effect is affected for genetic variations by their presence at interacting sites and non-interacting sites of the protein, or for individual SNPs versus SNPs as haplotype associated with a specific disease.</p></sec><sec id="s2"><title>2. Methods</title><p>As mentioned above, we formalize the prediction of SNP’s effects on proteins associated with specific diseases as a classification problem and adopt supervised learning strategy. Specifically, two powerful classifiers, random forest [<xref ref-type="bibr" rid="scirp.76090-ref22">22</xref>] and support vector machines [<xref ref-type="bibr" rid="scirp.76090-ref23">23</xref>], are selected for this study. For SVM, 3 different kernels were adopted and assessed: Linear, Radial Basis Function <inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/76090x1.png" xlink:type="simple"/></inline-formula> where the values for C = 3.46 and Polynomial <inline-formula><inline-graphic xlink:href="http://html.scirp.org/file/76090x2.png" xlink:type="simple"/></inline-formula> with degree d = 2 was applied. These values of C and degree of polynomial d were optimized by using Opunity 1.1.1, a python package.</p><p>Features, both sequential and structural, of proteins encoded by genes with SNPs that are believed to be relevant for the phenotypic properties are collected and quantified for use as input vector x to the classifier. Specifically, for this study, we are interested in two types of phenotypic properties: detrimental or polymorphic, corresponding to the output y of the binary classifier, namely, y = 1 for detrimental and 0 for polymorphic. The classifier is to learn the actual mapping from input to output: y = F(x), with a hypothesis function H(x, ɵ), where ɵ collectively represents the parameters of the classifier, for example the degree d of a polynomial kernel for SVM. The classifier is trained to minimize the empirical error</p><disp-formula id="scirp.76090-formula16"><label>(1)</label><graphic position="anchor" xlink:href="http://html.scirp.org/file/76090x3.png"  xlink:type="simple"/></disp-formula><p>for a set of n training examples x<sub>i</sub>, i = 1 to n, whose phenotypic property y<sub>i</sub> = F(x<sub>i</sub>) is known. Once the classifier is trained, it is used to make prediction / classification on unseen data, i.e., SNPs whose phenotypic property is not known a prior.</p><p>Feature selection plays a critical role in ensuring effective learning and reliable prediction. It has been known that mutations that occur at the interface between interacting proteins are more likely to cause detrimental effect as compared to present on other sites. Also, previous studies suggest that haplotype may have influence on whether a particular SNP may or may not manifest its phenotypic effect. Therefore, in this study, we are particularly interested in predicting the effect of non-synonymous SNPs on four types of common cancers in the context of SNPs being on protein interaction sites or within a haplotype.</p><p>The pipeline developed for this study consists of steps for data collection, feature characterization/quantification, classifier training, testing and evaluation, as shown in <xref ref-type="fig" rid="fig1">Figure 1</xref>. Detail for each step is given in the following subsections.</p><sec id="s2_1"><title>2.1. Data and Feature Characterization</title><p>SNPs and phenotypic effect for the four different types of cancers-acute myeloid leukemia (MIM # 601626), breast cancer (MIM#114480), colorectal cancer (MIM#114500) and esophageal cancer (MIM#114480) are collected from OMIM, one of the biggest databases which provides detailed information about phenotype-genotype relation [<xref ref-type="bibr" rid="scirp.76090-ref16">16</xref>].</p><p>To determine whether SNPs occur at protein-protein interaction sites, we used STRING database to identify the interaction sites for the affected proteins (i.e., the gene products) [<xref ref-type="bibr" rid="scirp.76090-ref17">17</xref>]. For Acute Myeloid Leukemia, 16 genes are in-</p><fig id="fig1"  position="float"><label><xref ref-type="fig" rid="fig1">Figure 1</xref></label><caption><title> Pipeline constructed for nsSNP prediction starting from gene collection to classification estimation</title></caption><graphic mimetype="image"   position="float"  xlink:type="simple"  xlink:href="http://html.scirp.org/file/76090x4.png"/></fig><p>volved, which result in 171 proteins that have certain interactions with each other. Due to unsolved 3D protein structures the set is reduced to 111 proteins. There are several databases which provide SNP data, including SwissProt and dbSNP. For this study we used SNP from SwissProt database [<xref ref-type="bibr" rid="scirp.76090-ref18">18</xref>] because of its large collection as compared to other databases. The queries to SwissProt identified 1399 nsSNP for these 111 proteins. The same data collection protocol is used for the other three cancers as well. After filtering with required protein structural as well as sequence properties, the final data set consists of 4056 SNP’s in total, as listed in <xref ref-type="table" rid="table1">Table 1</xref>.</p><p>Using these nsSNP, feature vector was constructed using several properties of both sequence and their respective structure. FoldX was used to calculate parameters which are important for protein stability [<xref ref-type="bibr" rid="scirp.76090-ref19">19</xref>]. It provides several important features along with the calculation of total energy for the mutant and the wild type protein. Panther software calculates Substitution Position-Specific Evolutionary Conservation (subPSEC) Scores and it is based on hidden Markov model (HMM). It was used to collect subPSEC score. Fathmm was used to calculate HMM cancer-specific pathogenicity weights [<xref ref-type="bibr" rid="scirp.76090-ref21">21</xref>]. In total 21 features were collected and all these features are shown in supplementary data S1.</p><p>We also collect haplotype data for genes associated with Acute Myleoid Leukemia. A haplotype is considered as set of polymorphic, which are inherited together. It is referred to a combination of alleles or a set of SNP that are found on the same chromosome [<xref ref-type="bibr" rid="scirp.76090-ref15">15</xref>]. To collect haplotype information two databases were used in this study. One is HapMapProject and the other is UCSC genome browser [<xref ref-type="bibr" rid="scirp.76090-ref25">25</xref>] [<xref ref-type="bibr" rid="scirp.76090-ref26">26</xref>]. HapMap Project has a wide range of SNPs, which are collected from dbSNP. Since our dataset consists of SNPs collected from SwissProt, to collect as many as haplotype data, we incorporate UCSC genome browser, which provides gene based common allele variants taken from 1000 genome project [<xref ref-type="bibr" rid="scirp.76090-ref27">27</xref>].</p></sec><sec id="s2_2"><title>2.2. Cross-Validation and Evaluation</title><p>To assess the prediction performance, we adopt the widely accepted cross-vali-</p><table-wrap id="table1" ><label><xref ref-type="table" rid="table1">Table 1</xref></label><caption><title> Data distribution for cancer type representing polymorphic and detrimental SNP’s</title></caption><table><tbody><thead><tr><th align="center" valign="middle" >Cancer</th><th align="center" valign="middle" >Polymorphic</th><th align="center" valign="middle" >Detrimental</th><th align="center" valign="middle" >Total</th></tr></thead><tr><td align="center" valign="middle" >Acute Myeloid Leukemia</td><td align="center" valign="middle" >1131</td><td align="center" valign="middle" >268</td><td align="center" valign="middle" >1399</td></tr><tr><td align="center" valign="middle" >Breast Cancer</td><td align="center" valign="middle" >1087</td><td align="center" valign="middle" >145</td><td align="center" valign="middle" >1232</td></tr><tr><td align="center" valign="middle" >Colorectal Cancer</td><td align="center" valign="middle" >983</td><td align="center" valign="middle" >131</td><td align="center" valign="middle" >1114</td></tr><tr><td align="center" valign="middle" >Esophageal Cancer</td><td align="center" valign="middle" >961</td><td align="center" valign="middle" >94</td><td align="center" valign="middle" >1055</td></tr><tr><td align="center" valign="middle" >Total</td><td align="center" valign="middle" >3473</td><td align="center" valign="middle" >583</td><td align="center" valign="middle" >4056</td></tr></tbody></table></table-wrap><p>dation scheme. Specifically, we used 10-fold cross-validation. The data is randomly split to 10 equal-sized subsets, and one set is reserved for testing and the remaining 9 subsets are combined into a training set to train the classifier. This process is repeated 10 times, with each subset being used as test set once and the average performance from 10 runs is reported. We used some commonly used measurements to report the performance, which includes accuracy, precision, recall, F1 score, and MCC, defined as follows.</p><disp-formula id="scirp.76090-formula17"><graphic  xlink:href="http://html.scirp.org/file/76090x5.png"  xlink:type="simple"/></disp-formula><disp-formula id="scirp.76090-formula18"><graphic  xlink:href="http://html.scirp.org/file/76090x6.png"  xlink:type="simple"/></disp-formula><disp-formula id="scirp.76090-formula19"><graphic  xlink:href="http://html.scirp.org/file/76090x7.png"  xlink:type="simple"/></disp-formula><disp-formula id="scirp.76090-formula20"><graphic  xlink:href="http://html.scirp.org/file/76090x8.png"  xlink:type="simple"/></disp-formula><p>where TP stands for true positive when a SNP is correctly predicted as detrimental, TN for true negative when a SNP is correctly predicted as polymorphism, FP for false positive when a SNP is incorrectly predicted as detrimental; and FN for false negative when a SNP is incorrectly predicted as polymorphism.</p><p>We also evaluate the performance using receiver operating characteristic (ROC) curve and Receiver operating characteristic (ROC) score.ROC is a graphical representation that illustrates the performance of a binary classifier system. The plot is created by plotting the true positive rate (TPR) against the false positive rate (FPR) at various threshold settings. The true-positive rate is also known as sensitivity or recall while false-positive rate is also known (1 − specificity) [<xref ref-type="bibr" rid="scirp.76090-ref28">28</xref>].</p></sec></sec><sec id="s3"><title>3. Results and Discussions</title><p>In this study we carried out comprehensive comparative analysis of predicting SNPs effects on four types of cancers. Specifically, we examined the following four different scenarios:</p><p>1. Comparison using structural properties only, or sequence properties only or combine effect of both properties using different classifiers;</p><p>2. Specific cancer SNP’s prediction or collection of cancers SNP’s prediction;</p><p>3. SNP’s prediction for residues at interacting sites or non-interacting sites;</p><p>4. SNP’s prediction for SNPs within haplotype or individual SNP’s.</p><p>Note that, due to data collection issues, the last two types of analysis were only performed for Acute Myeloid Leukemia.</p><sec id="s3_1"><title>3.1. Comparison Using Structural Properties Only, or Sequence Properties Only or Combine Effect of Both Properties Using Different Classifier</title><p>For the 4056 SNP’s listed in <xref ref-type="table" rid="table1">Table 1</xref>, three different datasets were generated. All three datasets have the same number of instances but different dimensionality of the feature vector. First dataset had 3 (sequential) features in it, second dataset had 18 (structural) features and the last dataset had all 21features in it. Receiver operating characteristic (ROC) score was calculated for 10-Fold cross validation and the mean of those score is represented in <xref ref-type="table" rid="table2">Table 2</xref> and <xref ref-type="fig" rid="fig2">Figure 2</xref> respectively.</p><p>The results clearly show that using structural and sequence based features together for SNP Prediction provides better results as compared to individual protein properties. It also suggests that hybrid features provide better results for any combination of features used. It also shows that random forest performs better among other classifiers used in this task.</p></sec><sec id="s3_2"><title>3.2. Specific Disease SNP’s Prediction or Collection of Diseases SNP’s Prediction</title><p>For this task, data was collected for four different cancers that are breast cancer,</p><fig id="fig2"  position="float"><label><xref ref-type="fig" rid="fig2">Figure 2</xref></label><caption><title> Classifier performance using ROC Score for sequence based, structure based and hybrid protein properties</title></caption><graphic mimetype="image"   position="float"  xlink:type="simple"  xlink:href="http://html.scirp.org/file/76090x9.png"/></fig><table-wrap id="table2" ><label><xref ref-type="table" rid="table2">Table 2</xref></label><caption><title> Mean ROC score for SNP prediction using different classifiers for specific protein based properties</title></caption><table><tbody><thead><tr><th align="center" valign="middle" >Classifier</th><th align="center" valign="middle" >Sequence Based Features</th><th align="center" valign="middle" >Structure Based Features</th><th align="center" valign="middle" >Hybrid Features</th></tr></thead><tr><td align="center" valign="middle" >SVM Linear</td><td align="center" valign="middle" >0.63</td><td align="center" valign="middle" >0.5</td><td align="center" valign="middle" >0.74</td></tr><tr><td align="center" valign="middle" >SVM RBF</td><td align="center" valign="middle" >0.76</td><td align="center" valign="middle" >0.7</td><td align="center" valign="middle" >0.81</td></tr><tr><td align="center" valign="middle" >SVM Polynomial</td><td align="center" valign="middle" >0.58</td><td align="center" valign="middle" >0.6</td><td align="center" valign="middle" >0.67</td></tr><tr><td align="center" valign="middle" >Random Forest</td><td align="center" valign="middle" >0.9</td><td align="center" valign="middle" >0.82</td><td align="center" valign="middle" >0.92</td></tr></tbody></table></table-wrap><p>colorectal cancer, esophageal cancer and acute myeloid leukemia, see <xref ref-type="table" rid="table1">Table 1</xref>. It was observed that very few genes, such as TP53, were common for all types of cancers collected for this study and generally in all types of cancers. It can be seen from <xref ref-type="table" rid="table1">Table 1</xref> that the number of detrimental SNPs is low as compared to the polymorphic SNP’s. The difference is almost three times between two types of SNPs. Prediction performance for every classifier for each disease was studied. <xref ref-type="table" rid="table3">Table 3</xref> lists the performance of each classifier on both detrimental as well as polymorphic SNP.</p><table-wrap id="table3" ><label><xref ref-type="table" rid="table3">Table 3</xref></label><caption><title> Evaluation metric score for each cancer using four different classifiers</title></caption><table><tbody><thead><tr><th align="center" valign="middle" >Cancer Type</th><th align="center" valign="middle" >Classifier</th><th align="center" valign="middle" >SNP Type</th><th align="center" valign="middle" >Precision</th><th align="center" valign="middle" >Recall</th><th align="center" valign="middle" >F1-Score</th><th align="center" valign="middle" >Accuracy</th></tr></thead><tr><td align="center" valign="middle"  rowspan="8"  >Acute Myeloid Leukemia</td><td align="center" valign="middle"  rowspan="2"  >SVM Linear</td><td align="center" valign="middle" >Polymorphic</td><td align="center" valign="middle" >0.87</td><td align="center" valign="middle" >0.91</td><td align="center" valign="middle" >0.89</td><td align="center" valign="middle" ></td></tr><tr><td align="center" valign="middle" >Detrimental</td><td align="center" valign="middle" >0.53</td><td align="center" valign="middle" >0.41</td><td align="center" valign="middle" >0.46</td><td align="center" valign="middle" >0.82</td></tr><tr><td align="center" valign="middle"  rowspan="2"  >SVM RBF</td><td align="center" valign="middle" >Polymorphic</td><td align="center" valign="middle" >0.84</td><td align="center" valign="middle" >0.94</td><td align="center" valign="middle" >0.89</td><td align="center" valign="middle" ></td></tr><tr><td align="center" valign="middle" >Detrimental</td><td align="center" valign="middle" >0.5</td><td align="center" valign="middle" >0.26</td><td align="center" valign="middle" >0.34</td><td align="center" valign="middle" >0.81</td></tr><tr><td align="center" valign="middle"  rowspan="2"  >SVM Polynomial</td><td align="center" valign="middle" >Polymorphic</td><td align="center" valign="middle" >0.83</td><td align="center" valign="middle" >0.96</td><td align="center" valign="middle" >0.89</td><td align="center" valign="middle" ></td></tr><tr><td align="center" valign="middle" >Detrimental</td><td align="center" valign="middle" >0.51</td><td align="center" valign="middle" >0.17</td><td align="center" valign="middle" >0.26</td><td align="center" valign="middle" >0.81</td></tr><tr><td align="center" valign="middle"  rowspan="2"  >Random Forest</td><td align="center" valign="middle" >Polymorphic</td><td align="center" valign="middle" >0.86</td><td align="center" valign="middle" >0.92</td><td align="center" valign="middle" >0.89</td><td align="center" valign="middle" ></td></tr><tr><td align="center" valign="middle" >Detrimental</td><td align="center" valign="middle" >0.51</td><td align="center" valign="middle" >0.35</td><td align="center" valign="middle" >0.41</td><td align="center" valign="middle" >0.81</td></tr><tr><td align="center" valign="middle"  rowspan="8"  >Breast Cancer</td><td align="center" valign="middle"  rowspan="2"  >SVM Linear</td><td align="center" valign="middle" >Polymorphic</td><td align="center" valign="middle" >0.88</td><td align="center" valign="middle" >0.9</td><td align="center" valign="middle" >0.89</td><td align="center" valign="middle" ></td></tr><tr><td align="center" valign="middle" >Detrimental</td><td align="center" valign="middle" >0.13</td><td align="center" valign="middle" >0.1</td><td align="center" valign="middle" >0.11</td><td align="center" valign="middle" >0.81</td></tr><tr><td align="center" valign="middle"  rowspan="2"  >SVM RBF</td><td align="center" valign="middle" >Polymorphic</td><td align="center" valign="middle" >0.88</td><td align="center" valign="middle" >0.91</td><td align="center" valign="middle" >0.9</td><td align="center" valign="middle" ></td></tr><tr><td align="center" valign="middle" >Detrimental</td><td align="center" valign="middle" >0.11</td><td align="center" valign="middle" >0.08</td><td align="center" valign="middle" >0.09</td><td align="center" valign="middle" >0.81</td></tr><tr><td align="center" valign="middle"  rowspan="2"  >SVM Polynomial</td><td align="center" valign="middle" >Polymorphic</td><td align="center" valign="middle" >0.88</td><td align="center" valign="middle" >0.9</td><td align="center" valign="middle" >0.89</td><td align="center" valign="middle" ></td></tr><tr><td align="center" valign="middle" >Detrimental</td><td align="center" valign="middle" >0.13</td><td align="center" valign="middle" >0.11</td><td align="center" valign="middle" >0.12</td><td align="center" valign="middle" >0.81</td></tr><tr><td align="center" valign="middle"  rowspan="2"  >Random Forest</td><td align="center" valign="middle" >Polymorphic</td><td align="center" valign="middle" >0.89</td><td align="center" valign="middle" >0.88</td><td align="center" valign="middle" >0.88</td><td align="center" valign="middle" ></td></tr><tr><td align="center" valign="middle" >Detrimental</td><td align="center" valign="middle" >0.14</td><td align="center" valign="middle" >0.15</td><td align="center" valign="middle" >0.15</td><td align="center" valign="middle" >0.81</td></tr><tr><td align="center" valign="middle"  rowspan="8"  >Colorectal Cancer</td><td align="center" valign="middle"  rowspan="2"  >SVM Linear</td><td align="center" valign="middle" >Polymorphic</td><td align="center" valign="middle" >0.88</td><td align="center" valign="middle" >0.96</td><td align="center" valign="middle" >0.91</td><td align="center" valign="middle" ></td></tr><tr><td align="center" valign="middle" >Detrimental</td><td align="center" valign="middle" >0</td><td align="center" valign="middle" >0</td><td align="center" valign="middle" >0</td><td align="center" valign="middle" >0.84</td></tr><tr><td align="center" valign="middle"  rowspan="2"  >SVM RBF</td><td align="center" valign="middle" >Polymorphic</td><td align="center" valign="middle" >0.88</td><td align="center" valign="middle" >0.96</td><td align="center" valign="middle" >0.92</td><td align="center" valign="middle" ></td></tr><tr><td align="center" valign="middle" >Detrimental</td><td align="center" valign="middle" >0.07</td><td align="center" valign="middle" >0.02</td><td align="center" valign="middle" >0.03</td><td align="center" valign="middle" >0.85</td></tr><tr><td align="center" valign="middle"  rowspan="2"  >SVM Polynomial</td><td align="center" valign="middle" >Polymorphic</td><td align="center" valign="middle" >0.88</td><td align="center" valign="middle" >0.95</td><td align="center" valign="middle" >0.91</td><td align="center" valign="middle" ></td></tr><tr><td align="center" valign="middle" >Detrimental</td><td align="center" valign="middle" >0</td><td align="center" valign="middle" >0</td><td align="center" valign="middle" >0</td><td align="center" valign="middle" >0.84</td></tr><tr><td align="center" valign="middle"  rowspan="2"  >Random Forest</td><td align="center" valign="middle" >Polymorphic</td><td align="center" valign="middle" >0.89</td><td align="center" valign="middle" >0.94</td><td align="center" valign="middle" >0.91</td><td align="center" valign="middle" ></td></tr><tr><td align="center" valign="middle" >Detrimental</td><td align="center" valign="middle" >0.26</td><td align="center" valign="middle" >0.17</td><td align="center" valign="middle" >0.2</td><td align="center" valign="middle" >0.84</td></tr><tr><td align="center" valign="middle"  rowspan="8"  >Esophageal Cancer</td><td align="center" valign="middle"  rowspan="2"  >SVM Linear</td><td align="center" valign="middle" >Polymorphic</td><td align="center" valign="middle" >0.91</td><td align="center" valign="middle" >0.99</td><td align="center" valign="middle" >0.95</td><td align="center" valign="middle" ></td></tr><tr><td align="center" valign="middle" >Detrimental</td><td align="center" valign="middle" >0</td><td align="center" valign="middle" >0</td><td align="center" valign="middle" >0</td><td align="center" valign="middle" >0.9</td></tr><tr><td align="center" valign="middle"  rowspan="2"  >SVM RBF</td><td align="center" valign="middle" >Polymorphic</td><td align="center" valign="middle" >0.92</td><td align="center" valign="middle" >0.99</td><td align="center" valign="middle" >0.95</td><td align="center" valign="middle" ></td></tr><tr><td align="center" valign="middle" >Detrimental</td><td align="center" valign="middle" >0.44</td><td align="center" valign="middle" >0.07</td><td align="center" valign="middle" >0.13</td><td align="center" valign="middle" >0.91</td></tr><tr><td align="center" valign="middle"  rowspan="2"  >SVM Polynomial</td><td align="center" valign="middle" >Polymorphic</td><td align="center" valign="middle" >0.91</td><td align="center" valign="middle" >0.99</td><td align="center" valign="middle" >0.95</td><td align="center" valign="middle" ></td></tr><tr><td align="center" valign="middle" >Detrimental</td><td align="center" valign="middle" >0.08</td><td align="center" valign="middle" >0.01</td><td align="center" valign="middle" >0.02</td><td align="center" valign="middle" >0.9</td></tr><tr><td align="center" valign="middle"  rowspan="2"  >Random Forest</td><td align="center" valign="middle" >Polymorphic</td><td align="center" valign="middle" >0.91</td><td align="center" valign="middle" >0.98</td><td align="center" valign="middle" >0.94</td><td align="center" valign="middle" ></td></tr><tr><td align="center" valign="middle" >Detrimental</td><td align="center" valign="middle" >0.14</td><td align="center" valign="middle" >0.03</td><td align="center" valign="middle" >0.05</td><td align="center" valign="middle" >0.9</td></tr></tbody></table></table-wrap><p>The above table represents that SVM RBF performs better for esophageal and colorectal cancer and SVM linear performed better for acute myeloid leukemia, while all classifiers performed about equally well on breast cancer. It also shows that for polymorphic SNP prediction precision and recall is much better as compared to the detrimental SNPs. This may be attributed to the skewed data distribution. It is also noticeable that in terms of accuracy there is only 1% difference while using different classifiers.</p><p>Further, all the cancer types were lumped together to analyze their performance (shown in <xref ref-type="table" rid="table4">Table 4</xref>). It showed that random forest once again performed better. In order to further evaluate predictive power without using a fixed threshold to determine positive versus negative, receiver operating characteristic (ROC) score was calculated for all classifiers using 10-fold cross validation. The mean ROC score is represented in <xref ref-type="fig" rid="fig3">Figure 3</xref>. Results from mean ROC score show that except for acute myeloid leukemia for each disease random forest provides better score. And in general, all the ROC Scores are above 0.70.</p><p>Initially, it was hypothesized that SNP classification for individual disease will be better than that of combine diseases but results reflect the opposite. In order to further investigate couple of tasks were performed. It was noticed that there were six genes which are common and associated with cancer types selected for this study. These common genes were completely removed from data set and classification was performed. Results showed that mean ROC score for all the cases was less than 0.6 (shown in <xref ref-type="fig" rid="fig3">Figure 3</xref>). It provides a clue that if there is no common gene among diseases than SNP prediction for individual cancer type</p><fig id="fig3"  position="float"><label><xref ref-type="fig" rid="fig3">Figure 3</xref></label><caption><title> Mean ROC score plot for each cancer type using random forest (best classifier for study)</title></caption><graphic mimetype="image"   position="float"  xlink:type="simple"  xlink:href="http://html.scirp.org/file/76090x10.png"/></fig><table-wrap id="table4" ><label><xref ref-type="table" rid="table4">Table 4</xref></label><caption><title> Mean ROC score for balanced and unbalanced collective cancer dat</title></caption><table><tbody><thead><tr><th align="center" valign="middle" >Mean ROC Score</th><th align="center" valign="middle" >Combine Cancers</th><th align="center" valign="middle" >Single Instance</th><th align="center" valign="middle" >Balanced Data</th></tr></thead><tr><td align="center" valign="middle" >SVM Linear</td><td align="center" valign="middle" >0.61</td><td align="center" valign="middle" >0.69</td><td align="center" valign="middle" >0.88</td></tr><tr><td align="center" valign="middle" >SVM RBF</td><td align="center" valign="middle" >0.71</td><td align="center" valign="middle" >0.73</td><td align="center" valign="middle" >0.88</td></tr><tr><td align="center" valign="middle" >SVM Polynomial</td><td align="center" valign="middle" >0.7</td><td align="center" valign="middle" >0.72</td><td align="center" valign="middle" >0.88</td></tr><tr><td align="center" valign="middle" >Random Forest</td><td align="center" valign="middle" >0.9</td><td align="center" valign="middle" >0.76</td><td align="center" valign="middle" >0.9</td></tr></tbody></table></table-wrap><p>will be better but in general almost all the cancers have certain common genes.</p><p>Another task was performed to see how training be affected if the combination of all disease SNP without redundancy i.e. only single instance of SNP occur in the final dataset when this gene is shared by more than one cancer type. In this case ROC score was similar to every individual cancer type SNP classification.</p><p>It was noticed and mentioned earlier that detrimental SNP are much less in number than the polymorphic SNPs. It produces an unbalanced dataset. To see what impact data would make if the number of detrimental SNP is equal to polymorphic SNPs. Number of SNPs for polymorphic class was reduced and then classification task was performed. It does not show any change in ROC score for best classifier but the F1-score for detrimental SNPs was rapidly increased from 0.45 to 0.86. This change in detrimental SNP evaluation can be seen from <xref ref-type="table" rid="table5">Table 5</xref> as well as from the <xref ref-type="fig" rid="fig4">Figure 4</xref>. It was noticed that when data is balanced it does not affect polymorphic SNPs but classification of detrimental SNP is significantly improved.</p><p>Lastly mean ROC score was calculated using 10-fold cross validation for each classifier and found that random forest provides better results as compared to any other classifier. Note that there is no change in the mean ROC score for best classifier but SVM with its different kernels is performing better.</p><p>To assess the statistical significance for the difference between that set of combine cancers and the set of Acute Myeloid Leukemia, a t-test was performed on the ROC score of both datasets using random forest, and p-value is 0.007458. This concludes that random forest performs better than other classifiers when SNP’s prediction is done for any type of cancer.</p><fig id="fig4"  position="float"><label><xref ref-type="fig" rid="fig4">Figure 4</xref></label><caption><title> Detrimental SNP evaluation for Combined data, single instance data (non-re- dundant) and Balanced data. In case of balanced data performance is rapidly improved but in all cases random forest is performing better</title></caption><graphic mimetype="image"   position="float"  xlink:type="simple"  xlink:href="http://html.scirp.org/file/76090x11.png"/></fig><table-wrap id="table5" ><label><xref ref-type="table" rid="table5">Table 5</xref></label><caption><title> Evaluation metric score for combined cancer SNP using four different classifiers</title></caption><table><tbody><thead><tr><th align="center" valign="middle" >Cancer Type</th><th align="center" valign="middle" >Classifier</th><th align="center" valign="middle" >SNP Type</th><th align="center" valign="middle" >Precision</th><th align="center" valign="middle" >Recall</th><th align="center" valign="middle" >F1-Score</th><th align="center" valign="middle" >Accuracy</th></tr></thead><tr><td align="center" valign="middle"  rowspan="8"  >Combine Cancers</td><td align="center" valign="middle"  rowspan="2"  >SVM Linear</td><td align="center" valign="middle" >Polymorphic</td><td align="center" valign="middle" >0.86</td><td align="center" valign="middle" >0.98</td><td align="center" valign="middle" >0.91</td><td align="center" valign="middle" ></td></tr><tr><td align="center" valign="middle" >Detrimental</td><td align="center" valign="middle" >0.15</td><td align="center" valign="middle" >0.02</td><td align="center" valign="middle" >0.04</td><td align="center" valign="middle" >0.84</td></tr><tr><td align="center" valign="middle"  rowspan="2"  >SVM RBF</td><td align="center" valign="middle" >Polymorphic</td><td align="center" valign="middle" >0.87</td><td align="center" valign="middle" >0.97</td><td align="center" valign="middle" >0.92</td><td align="center" valign="middle" ></td></tr><tr><td align="center" valign="middle" >Detrimental</td><td align="center" valign="middle" >0.49</td><td align="center" valign="middle" >0.16</td><td align="center" valign="middle" >0.25</td><td align="center" valign="middle" >0.86</td></tr><tr><td align="center" valign="middle"  rowspan="2"  >SVM Polynomial</td><td align="center" valign="middle" >Polymorphic</td><td align="center" valign="middle" >0.86</td><td align="center" valign="middle" >0.98</td><td align="center" valign="middle" >0.92</td><td align="center" valign="middle" ></td></tr><tr><td align="center" valign="middle" >Detrimental</td><td align="center" valign="middle" >0.45</td><td align="center" valign="middle" >0.08</td><td align="center" valign="middle" >0.13</td><td align="center" valign="middle" >0.85</td></tr><tr><td align="center" valign="middle"  rowspan="2"  >Random Forest</td><td align="center" valign="middle" >Polymorphic</td><td align="center" valign="middle" >0.9</td><td align="center" valign="middle" >0.96</td><td align="center" valign="middle" >0.93</td><td align="center" valign="middle" ></td></tr><tr><td align="center" valign="middle" >Detrimental</td><td align="center" valign="middle" >0.6</td><td align="center" valign="middle" >0.35</td><td align="center" valign="middle" >0.45</td><td align="center" valign="middle" >0.87</td></tr><tr><td align="center" valign="middle"  rowspan="8"  >Single Instance</td><td align="center" valign="middle"  rowspan="2"  >SVM Linear</td><td align="center" valign="middle" >Polymorphic</td><td align="center" valign="middle" >0.77</td><td align="center" valign="middle" >0.84</td><td align="center" valign="middle" >0.8</td><td align="center" valign="middle"  rowspan="2"  >0.69</td></tr><tr><td align="center" valign="middle" >Detrimental</td><td align="center" valign="middle" >0.24</td><td align="center" valign="middle" >0.18</td><td align="center" valign="middle" >0.21</td></tr><tr><td align="center" valign="middle"  rowspan="2"  >SVM RBF</td><td align="center" valign="middle" >Polymorphic</td><td align="center" valign="middle" >0.8</td><td align="center" valign="middle" >0.85</td><td align="center" valign="middle" >0.82</td><td align="center" valign="middle"  rowspan="2"  >0.72</td></tr><tr><td align="center" valign="middle" >Detrimental</td><td align="center" valign="middle" >0.34</td><td align="center" valign="middle" >0.27</td><td align="center" valign="middle" >0.3</td></tr><tr><td align="center" valign="middle"  rowspan="2"  >SVM Polynomial</td><td align="center" valign="middle" >Polymorphic</td><td align="center" valign="middle" >0.79</td><td align="center" valign="middle" >0.93</td><td align="center" valign="middle" >0.85</td><td align="center" valign="middle"  rowspan="2"  >0.75</td></tr><tr><td align="center" valign="middle" >Detrimental</td><td align="center" valign="middle" >0.39</td><td align="center" valign="middle" >0.14</td><td align="center" valign="middle" >0.21</td></tr><tr><td align="center" valign="middle"  rowspan="2"  >Random Forest</td><td align="center" valign="middle" >Polymorphic</td><td align="center" valign="middle" >0.82</td><td align="center" valign="middle" >0.82</td><td align="center" valign="middle" >0.82</td><td align="center" valign="middle"  rowspan="2"  >0.73</td></tr><tr><td align="center" valign="middle" >Detrimental</td><td align="center" valign="middle" >0.39</td><td align="center" valign="middle" >0.4</td><td align="center" valign="middle" >0.4</td></tr><tr><td align="center" valign="middle"  rowspan="8"  >Balanced Data</td><td align="center" valign="middle"  rowspan="2"  >SVM Linear</td><td align="center" valign="middle" >Polymorphic</td><td align="center" valign="middle" >0.83</td><td align="center" valign="middle" >0.99</td><td align="center" valign="middle" >0.9</td><td align="center" valign="middle" ></td></tr><tr><td align="center" valign="middle" >Detrimental</td><td align="center" valign="middle" >0.93</td><td align="center" valign="middle" >0.79</td><td align="center" valign="middle" >0.88</td><td align="center" valign="middle" >0.89</td></tr><tr><td align="center" valign="middle"  rowspan="2"  >SVM RBF</td><td align="center" valign="middle" >Polymorphic</td><td align="center" valign="middle" >0.82</td><td align="center" valign="middle" >0.95</td><td align="center" valign="middle" >0.88</td><td align="center" valign="middle" ></td></tr><tr><td align="center" valign="middle" >Detrimental</td><td align="center" valign="middle" >0.94</td><td align="center" valign="middle" >0.79</td><td align="center" valign="middle" >0.86</td><td align="center" valign="middle" >0.87</td></tr><tr><td align="center" valign="middle"  rowspan="2"  >SVM Polynomial</td><td align="center" valign="middle" >Polymorphic</td><td align="center" valign="middle" >0.63</td><td align="center" valign="middle" >0.89</td><td align="center" valign="middle" >0.74</td><td align="center" valign="middle" ></td></tr><tr><td align="center" valign="middle" >Detrimental</td><td align="center" valign="middle" >0.81</td><td align="center" valign="middle" >0.47</td><td align="center" valign="middle" >0.6</td><td align="center" valign="middle" >0.68</td></tr><tr><td align="center" valign="middle"  rowspan="2"  >Random Forest</td><td align="center" valign="middle" >Polymorphic</td><td align="center" valign="middle" >0.83</td><td align="center" valign="middle" >0.92</td><td align="center" valign="middle" >0.87</td><td align="center" valign="middle" ></td></tr><tr><td align="center" valign="middle" >Detrimental</td><td align="center" valign="middle" >0.91</td><td align="center" valign="middle" >0.81</td><td align="center" valign="middle" >0.86</td><td align="center" valign="middle" >0.87</td></tr></tbody></table></table-wrap></sec><sec id="s3_3"><title>3.3. SNP Prediction for Residues at Interacting Site or Non-Interacting Site</title><p>nsSNP prediction was done at interacting site as well as non-interacting site. 3DID database (release: June 2015) was used to observe presence of a particular residue at interacting site. It was found that among 40 proteins associated with acute myeloid leukemia having solved 3D structure and nsSNP there are only 18 proteins which had information for their interacting and non-interacting residues recorded in the database. Two subsets were created for this problem one having SNPs at interacting residues and the other with SNPs at non-interacting residues. Data distribution is shown in <xref ref-type="table" rid="table6">Table 6</xref>.</p><p>Classification prediction was performed using same classifiers. Their performance with reference to precision, recall, F1-Scoreand accuracy is given below in <xref ref-type="table" rid="table7">Table 7</xref>. Data distribution is balanced for both subsets and thus it provides im-</p><table-wrap id="table6" ><label><xref ref-type="table" rid="table6">Table 6</xref></label><caption><title> SNPs at Interacting Sites versus Non-interacting Sites</title></caption><table><tbody><thead><tr><th align="center" valign="middle" >Acute Myeloid Leukemia</th><th align="center" valign="middle" >Polymorphic</th><th align="center" valign="middle" >Detrimental</th><th align="center" valign="middle" >Total</th></tr></thead><tr><td align="center" valign="middle" >Interacting Site Residue</td><td align="center" valign="middle" >58</td><td align="center" valign="middle" >43</td><td align="center" valign="middle" >101</td></tr><tr><td align="center" valign="middle" >Non-Interacting Site Residue</td><td align="center" valign="middle" >131</td><td align="center" valign="middle" >120</td><td align="center" valign="middle" >251</td></tr></tbody></table></table-wrap><table-wrap id="table7" ><label><xref ref-type="table" rid="table7">Table 7</xref></label><caption><title> Evaluation metric score for SNPs at interacting and non-interacting sites using four different classifiers</title></caption><table><tbody><thead><tr><th align="center" valign="middle" >Cancer Type</th><th align="center" valign="middle" >Classifier</th><th align="center" valign="middle" >SNP Type</th><th align="center" valign="middle" >Precision</th><th align="center" valign="middle" >Recall</th><th align="center" valign="middle" >F-Measure</th><th align="center" valign="middle" >Accuracy</th></tr></thead><tr><td align="center" valign="middle"  rowspan="8"  >Interacting Site Residues</td><td align="center" valign="middle"  rowspan="2"  >SVM Linear</td><td align="center" valign="middle" >Polymorphic</td><td align="center" valign="middle" >0.68</td><td align="center" valign="middle" >0.71</td><td align="center" valign="middle" >0.7</td><td align="center" valign="middle" ></td></tr><tr><td align="center" valign="middle" >Detrimental</td><td align="center" valign="middle" >0.6</td><td align="center" valign="middle" >0.58</td><td align="center" valign="middle" >0.59</td><td align="center" valign="middle" >0.65</td></tr><tr><td align="center" valign="middle"  rowspan="2"  >SVM RBF</td><td align="center" valign="middle" >Polymorphic</td><td align="center" valign="middle" >0.68</td><td align="center" valign="middle" >0.66</td><td align="center" valign="middle" >0.67</td><td align="center" valign="middle" ></td></tr><tr><td align="center" valign="middle" >Detrimental</td><td align="center" valign="middle" >0.56</td><td align="center" valign="middle" >0.58</td><td align="center" valign="middle" >0.57</td><td align="center" valign="middle" >0.62</td></tr><tr><td align="center" valign="middle"  rowspan="2"  >SVM Polynomial</td><td align="center" valign="middle" >Polymorphic</td><td align="center" valign="middle" >0.58</td><td align="center" valign="middle" >0.84</td><td align="center" valign="middle" >0.69</td><td align="center" valign="middle" ></td></tr><tr><td align="center" valign="middle" >Detrimental</td><td align="center" valign="middle" >0.44</td><td align="center" valign="middle" >0.16</td><td align="center" valign="middle" >0.24</td><td align="center" valign="middle" >0.57</td></tr><tr><td align="center" valign="middle"  rowspan="2"  >Random Forest</td><td align="center" valign="middle" >Polymorphic</td><td align="center" valign="middle" >0.68</td><td align="center" valign="middle" >0.74</td><td align="center" valign="middle" >0.71</td><td align="center" valign="middle" ></td></tr><tr><td align="center" valign="middle" >Detrimental</td><td align="center" valign="middle" >0.61</td><td align="center" valign="middle" >0.53</td><td align="center" valign="middle" >0.57</td><td align="center" valign="middle" >0.67</td></tr><tr><td align="center" valign="middle"  rowspan="8"  >Non-interacting Site residues</td><td align="center" valign="middle"  rowspan="2"  >SVM Linear</td><td align="center" valign="middle" >Polymorphic</td><td align="center" valign="middle" >0.54</td><td align="center" valign="middle" >0.56</td><td align="center" valign="middle" >0.55</td><td align="center" valign="middle" ></td></tr><tr><td align="center" valign="middle" >Detrimental</td><td align="center" valign="middle" >0.5</td><td align="center" valign="middle" >0.49</td><td align="center" valign="middle" >0.5</td><td align="center" valign="middle" >0.53</td></tr><tr><td align="center" valign="middle"  rowspan="2"  >SVM RBF</td><td align="center" valign="middle" >Polymorphic</td><td align="center" valign="middle" >0.54</td><td align="center" valign="middle" >0.58</td><td align="center" valign="middle" >0.56</td><td align="center" valign="middle" ></td></tr><tr><td align="center" valign="middle" >Detrimental</td><td align="center" valign="middle" >0.5</td><td align="center" valign="middle" >0.47</td><td align="center" valign="middle" >0.48</td><td align="center" valign="middle" >0.53</td></tr><tr><td align="center" valign="middle"  rowspan="2"  >SVM Polynomial</td><td align="center" valign="middle" >Polymorphic</td><td align="center" valign="middle" >0.59</td><td align="center" valign="middle" >0.89</td><td align="center" valign="middle" >0.71</td><td align="center" valign="middle" ></td></tr><tr><td align="center" valign="middle" >Detrimental</td><td align="center" valign="middle" >0.72</td><td align="center" valign="middle" >0.32</td><td align="center" valign="middle" >0.44</td><td align="center" valign="middle" >0.61</td></tr><tr><td align="center" valign="middle"  rowspan="2"  >Random Forest</td><td align="center" valign="middle" >Polymorphic</td><td align="center" valign="middle" >0.56</td><td align="center" valign="middle" >0.56</td><td align="center" valign="middle" >0.56</td><td align="center" valign="middle" ></td></tr><tr><td align="center" valign="middle" >Detrimental</td><td align="center" valign="middle" >0.52</td><td align="center" valign="middle" >0.53</td><td align="center" valign="middle" >0.52</td><td align="center" valign="middle" >0.55</td></tr></tbody></table></table-wrap><p>proved results for both datasets when compared to task one datasets in terms of polymorphic and detrimental prediction.</p><p>While the overall performance has been dropped, there is an improved performance for prediction of detrimental SNP’s. Further, ROC score was determined for all classifiers for both datasets as shown in <xref ref-type="fig" rid="fig6">Figure 6</xref>. The upper panel is for all the classifier trained and tested for SNPs at interacting sites and the lower panel is for non-interacting site SNP’s. Mean ROC score for SVM RBF and SVM polynomial were same i.e. 0.86 for both datasets but in case of non-interacting site residues SVM polynomial is performing better with 0.66 score. It concludes that when overall performance of two datasets is considered SVM polynomial has better performance than any other classifier. Lastly to verify the statistical significance of the performance difference, a t-test was performed on the 10-fold cross validation of SVM polynomial ROC score and it was found that p-value is 0.020197, confirming the statistical significance of the difference.</p></sec><sec id="s3_4"><title>3.4. SNP Prediction Individual SNPs vs SNPs within Haplotype</title><p>In this analysis, we examine predicting SNPs effect in the context of haplotype,</p><fig id="fig5"  position="float"><label><xref ref-type="fig" rid="fig5">Figure 5</xref></label><caption><title> SNP data distribution for acute myeloid leukemia at interacting and noninteracting site of protei</title></caption><graphic mimetype="image"   position="float"  xlink:type="simple"  xlink:href="http://html.scirp.org/file/76090x12.png"/></fig><fig id="fig6"  position="float"><label><xref ref-type="fig" rid="fig6">Figure 6</xref></label><caption><title> Mean ROC score plot for several classifiers at interacting site (upper plot) and at noninteracting site (lower plot) of protein</title></caption><graphic mimetype="image"   position="float"  xlink:type="simple"  xlink:href="http://html.scirp.org/file/76090x13.png"/></fig><p>i.e., the prediction of individual SNPs versus SNPs within a known haplotype. The search against database from HapMap Project and the other is UCSC genome browser only identified haplotypes from 14 genes from the gene pool associated with acute myeloid leukemia. Haplotypes were considered in pair only that means each single SNP in haplotype was compared to every haplotype allelic change within same gene including self-replication. In this task, two subsets were generated: one set consists of haplotypes pairs and the other set consists of all individual SNPs associated with genes involved in acute myeloid leukemia. Data distribution for these two subsets is given in <xref ref-type="table" rid="table8">Table 8</xref>.</p><p>For training 10-fold cross validation was applied to both datasets using SVM with three kernels and random forest. The results for this classification problem are shown in <xref ref-type="table" rid="table9">Table 9</xref>.</p><p>In <xref ref-type="table" rid="table9">Table 9</xref> we can see easily that the best accuracy in predicting haplotype pair is 0.91, a significant increase over 0.82, the best accuracy in predicting individual SNPs. Also, we notice a clear advantage of Random forest for predicting haplotype pairs across the board on all four metrics, whereas SVM Polynomial per-</p><table-wrap id="table8" ><label><xref ref-type="table" rid="table8">Table 8</xref></label><caption><title> Data distribution for haplotype and individual gene in acute myeloid leukemia</title></caption><table><tbody><thead><tr><th align="center" valign="middle" >Acute Myeloid Leukemia</th><th align="center" valign="middle" >Polymorphism</th><th align="center" valign="middle" >Detrimental</th><th align="center" valign="middle" >Total</th></tr></thead><tr><td align="center" valign="middle" >Haplotype Pair</td><td align="center" valign="middle" >1109</td><td align="center" valign="middle" >316</td><td align="center" valign="middle" >1425</td></tr><tr><td align="center" valign="middle" >Individual SNP’s</td><td align="center" valign="middle" >1053</td><td align="center" valign="middle" >217</td><td align="center" valign="middle" >1270</td></tr></tbody></table></table-wrap><table-wrap id="table9" ><label><xref ref-type="table" rid="table9">Table 9</xref></label><caption><title> Evaluation metric score for SNPs in haplotype pair or individual SNP using four different classifiers</title></caption><table><tbody><thead><tr><th align="center" valign="middle" >Cancer Type</th><th align="center" valign="middle" >Classifier</th><th align="center" valign="middle" >SNP Type</th><th align="center" valign="middle" >Precision</th><th align="center" valign="middle" >Recall</th><th align="center" valign="middle" >F1-Score</th><th align="center" valign="middle" >Accuracy</th></tr></thead><tr><td align="center" valign="middle"  rowspan="8"  >Haplotype Pair</td><td align="center" valign="middle"  rowspan="2"  >SVM Linear</td><td align="center" valign="middle" >Polymorphic</td><td align="center" valign="middle" >0.85</td><td align="center" valign="middle" >0.81</td><td align="center" valign="middle" >0.83</td><td align="center" valign="middle" ></td></tr><tr><td align="center" valign="middle" >Detrimental</td><td align="center" valign="middle" >0.43</td><td align="center" valign="middle" >0.5</td><td align="center" valign="middle" >0.46</td><td align="center" valign="middle" >0.74</td></tr><tr><td align="center" valign="middle"  rowspan="2"  >SVM RBF</td><td align="center" valign="middle" >Polymorphic</td><td align="center" valign="middle" >0.88</td><td align="center" valign="middle" >0.87</td><td align="center" valign="middle" >0.88</td><td align="center" valign="middle" ></td></tr><tr><td align="center" valign="middle" >Detrimental</td><td align="center" valign="middle" >0.57</td><td align="center" valign="middle" >0.6</td><td align="center" valign="middle" >0.58</td><td align="center" valign="middle" >0.81</td></tr><tr><td align="center" valign="middle"  rowspan="2"  >SVM Polynomial</td><td align="center" valign="middle" >Polymorphic</td><td align="center" valign="middle" >0.88</td><td align="center" valign="middle" >0.88</td><td align="center" valign="middle" >0.88</td><td align="center" valign="middle" ></td></tr><tr><td align="center" valign="middle" >Detrimental</td><td align="center" valign="middle" >0.59</td><td align="center" valign="middle" >0.59</td><td align="center" valign="middle" >0.59</td><td align="center" valign="middle" >0.82</td></tr><tr><td align="center" valign="middle"  rowspan="2"  >Random Forest</td><td align="center" valign="middle" >Polymorphic</td><td align="center" valign="middle" >0.96</td><td align="center" valign="middle" >0.92</td><td align="center" valign="middle" >0.94</td><td align="center" valign="middle" ></td></tr><tr><td align="center" valign="middle" >Detrimental</td><td align="center" valign="middle" >0.75</td><td align="center" valign="middle" >0.88</td><td align="center" valign="middle" >0.81</td><td align="center" valign="middle" >0.91</td></tr><tr><td align="center" valign="middle"  rowspan="8"  >Individual SNP</td><td align="center" valign="middle"  rowspan="2"  >SVM Linear</td><td align="center" valign="middle" >Polymorphic</td><td align="center" valign="middle" >0.87</td><td align="center" valign="middle" >0.91</td><td align="center" valign="middle" >0.89</td><td align="center" valign="middle"  rowspan="2"  >0.81</td></tr><tr><td align="center" valign="middle" >Detrimental</td><td align="center" valign="middle" >0.44</td><td align="center" valign="middle" >0.35</td><td align="center" valign="middle" >0.39</td></tr><tr><td align="center" valign="middle"  rowspan="2"  >SVM RBF</td><td align="center" valign="middle" >Polymorphic</td><td align="center" valign="middle" >0.85</td><td align="center" valign="middle" >0.92</td><td align="center" valign="middle" >0.88</td><td align="center" valign="middle" ></td></tr><tr><td align="center" valign="middle" >Detrimental</td><td align="center" valign="middle" >0.37</td><td align="center" valign="middle" >0.24</td><td align="center" valign="middle" >0.3</td><td align="center" valign="middle" >0.8</td></tr><tr><td align="center" valign="middle"  rowspan="2"  >SVM Polynomial</td><td align="center" valign="middle" >Polymorphic</td><td align="center" valign="middle" >0.86</td><td align="center" valign="middle" >0.93</td><td align="center" valign="middle" >0.9</td><td align="center" valign="middle" ></td></tr><tr><td align="center" valign="middle" >Detrimental</td><td align="center" valign="middle" >0.45</td><td align="center" valign="middle" >0.27</td><td align="center" valign="middle" >0.34</td><td align="center" valign="middle" >0.82</td></tr><tr><td align="center" valign="middle"  rowspan="2"  >Random Forest</td><td align="center" valign="middle" >Polymorphic</td><td align="center" valign="middle" >0.85</td><td align="center" valign="middle" >0.87</td><td align="center" valign="middle" >0.87</td><td align="center" valign="middle" ></td></tr><tr><td align="center" valign="middle" >Detrimental</td><td align="center" valign="middle" >0.32</td><td align="center" valign="middle" >0.3</td><td align="center" valign="middle" >0.32</td><td align="center" valign="middle" >0.79</td></tr></tbody></table></table-wrap><p>forms slightly better for predicting of individual SNPs. In particularly, it is worth noting that the F1-score for haplotype pair of detrimental phenotype is 0.81 by Random Forest classifier, which is a very impressive performance given that the datasets (<xref ref-type="table" rid="table8">Table 8</xref>) are quite skewed toward polymorphic phenotype and therefore present a greater challenge for correctly predicting the detrimental phenotype. The four metrics used in <xref ref-type="table" rid="table9">Table 9</xref> all depend on a fixed threshold for prediction. ROC curve and score can evaluate a classifier’s predictive power and performance without relying on a specific prediction threshold. In <xref ref-type="fig" rid="fig7">Figure 7</xref>, ROC curves and scores are shown for haplotype SNP pairs (top panel) and individual SNPs (bottom panel). The two key observations from <xref ref-type="table" rid="table9">Table 9</xref> are essential maintained: a) pairing SNPs in haplotype help improve phenotype prediction (ROC score = 0.95, achieved by RF), as compared to predicting phenotype for individual SNPs (ROC score = 0.81, achieved by SVM-RBF); b) while RF generally performs better, SVM-RBF has a slight edge in predicting individual SNPs.</p><p>Again, a t-test was performed on ROC scores from the 10-fold cross validation using Random Forest for haplotype pair versus individual SNPs. The p-value is</p><fig id="fig7"  position="float"><label><xref ref-type="fig" rid="fig7">Figure 7</xref></label><caption><title> Mean ROC score plot for haplotype pair (upper panel) and individual SNP prediction (lower panel)</title></caption><graphic mimetype="image"   position="float"  xlink:type="simple"  xlink:href="http://html.scirp.org/file/76090x14.png"/></fig><p>7.8 &#215; 10<sup>−15</sup>, confirming the statistical significance of the difference.</p><p>Overall, it suggests that Random forest is the better classifier for most of the tasks performed in this study. An exception was seen for task 3, where SVM polynomial is providing better results.</p></sec></sec><sec id="s4"><title>4. Conclusions and Future Work</title><p>In this work, we carried out comprehensive comparative analysis for predicting SNPs effect associated with four types of cancers, in the context of SNPs being present at protein interacting sites versus non-interacting sites and being paired within a known haplotype versus being unpaired.</p><p>Our results confirm that prediction performance is generally improved from using both sequential features and structural features than using them separately. Also, of the two types of classifiers used in the study, random forest outperforms in most cases.</p><p>It is found that generic SNP prediction provides better association of particular SNP to be detrimental or polymorphic SNPs as compared to disease-specific SNPs, although this conclusion does not hold if genes associated with one disease are unique from the other disease. While it is expected that prediction performance will be increased by associating SNPs to the interacting sites, the results show instead slight decrease in performance. This decrease in predicting accuracy may be caused by the small data set, as many affected proteins in the study do not have known interacting sites.</p><p>Compared to individual SNPs, these that appear together in haplotype showed stronger correlation with one another and with the phenotype, and therefore led to better prediction performance. Haplotype SNP prediction provided most promising results. This could be taken to the next level of improving further accuracy and developing personalized drug. Although currently the haplotype classification and protein site classification was performed for only Acute Myeloid Leukemia, the same protocol can be adopted to perform similar analysis on other diseases.</p><p>Lastly, while this study was performed on cancer diseases only, the same protocol could be applied for the prediction of non-cancerous diseases in order to make this protocol generic for all diseases.</p></sec><sec id="s5"><title>Cite this paper</title><p>Akram, P. and Li, L. (2017) Cancer Specific Non-Synonymous Single Nucleotide Polymorphism Prediction in the Context of Haplotype and Protein Interacting Sites. J. Biomedical Science and Engineering, 10, 28-44. https://doi.org/10.4236/jbise.2017.105B004</p></sec><sec id="s6"><title>Supplementary Data</title><p>S1: Feature name and description about each feature.</p><disp-formula id="scirp.76090-formula21"><graphic  xlink:href="http://html.scirp.org/file/76090x15.png"  xlink:type="simple"/></disp-formula><p>Submit or recommend next manuscript to SCIRP and we will provide best service for you:</p><p>Accepting pre-submission inquiries through Email, Facebook, LinkedIn, Twitter, etc.</p><p>A wide selection of journals (inclusive of 9 subjects, more than 200 journals)</p><p>Providing 24-hour high-quality service</p><p>User-friendly online submission system</p><p>Fair and swift peer-review system</p><p>Efficient typesetting and proofreading procedure</p><p>Display of the result of downloads and visits, as well as the number of cited articles</p><p>Maximum dissemination of your research work</p><p>Submit your manuscript at: http://papersubmission.scirp.org/</p><p>Or contact jbise@scirp.org</p></sec></body><back><ref-list><title>References</title><ref id="scirp.76090-ref1"><label>1</label><mixed-citation publication-type="other" xlink:type="simple">Wu, J., Gan, M., and Jiang, R. (2011) Prioritisation of Candidate Single Amino Acid Polymorphisms Using One-Class Learning Machines. International Journal of Computational Biology and Drug Design, 4, 316–331. 
https://doi.org/10.1504/IJCBDD.2011.044446</mixed-citation></ref><ref id="scirp.76090-ref2"><label>2</label><mixed-citation publication-type="other" xlink:type="simple">David, A., Razali, R., Wass, M.N. and Sternberg, M.J. (2012) Protein-protein Interaction Sites are Hotspots for Disease-Associated Nonsynonymous SNPs. Hum Mutat 33, 359–363. https://doi.org/10.1002/humu.21656</mixed-citation></ref><ref id="scirp.76090-ref3"><label>3</label><mixed-citation publication-type="other" xlink:type="simple">Basit, N. and Wechsler, H. (2011) Prediction of Enzyme Mutant Activity Using Computa-tional Mutagenesis and Incremental Transduction. Advances in bioinformatics. Adv Bioinformatics, 2011, 958129. https://doi.org/10.1155/2011/958129</mixed-citation></ref><ref id="scirp.76090-ref4"><label>4</label><mixed-citation publication-type="other" xlink:type="simple">Lee, T.S. and York, D.M. (2010) Computational Mutagenesis Studies of Hammerhead Ribozyme Catalysis. J Am ChemSoc, 132, 13505–13518.  
https://doi.org/10.1021/ja105956u</mixed-citation></ref><ref id="scirp.76090-ref5"><label>5</label><mixed-citation publication-type="other" xlink:type="simple">Masso, M. and Vaisman, II. (2010) Knowledge-based Computational Mutagenesis for Pre-dicting the Disease Potential of Human Non-Synonymous Single Nucleotide Polymorphisms. J TheorBiol , 266, 560–568.  
https://doi.org/10.1016/j.jtbi.2010.07.026</mixed-citation></ref><ref id="scirp.76090-ref6"><label>6</label><mixed-citation publication-type="other" xlink:type="simple">Bradshaw, R.T., Patel, B.H., Tate, E.W., Leatherbarrow, R.J. and Gould, I.R. (2011) Comparing Experimental and Computational Alanine Scanning Techniques for Probing a Prototypical Protein–Protein Interaction. Protein Engineering Design and Selection, 24, 197–207. https://doi.org/10.1093/protein/gzq047</mixed-citation></ref><ref id="scirp.76090-ref7"><label>7</label><mixed-citation publication-type="other" xlink:type="simple">Adzhubei, I.A., Schmidt, S., Peshkin, L., Ramensky, V.E., Gerasimova, A., et al. (2010) A Method and Server for Predicting Damaging Missense Mutations. Nat Methods, 7, 248–249. https://doi.org/10.1038/nmeth0410-248</mixed-citation></ref><ref id="scirp.76090-ref8"><label>8</label><mixed-citation publication-type="other" xlink:type="simple">Li, M.X., Kwan, J.S., Bao, S.Y., Yang, W., Ho, S.L., et al. (2013) Predicting Mendelian Disease-Causing Non-Synonymous Single Nucleotide Variants in Exome Sequencing Studies. PLoS Genet, 9, e1003143. 
https://doi.org/10.1371/journal.pgen.1003143</mixed-citation></ref><ref id="scirp.76090-ref9"><label>9</label><mixed-citation publication-type="other" xlink:type="simple">Gnad, F., Baucom, A., Mukhyala, K., Manning, G. and Zhang, Z. (2013) As-sessment of Computational Methods for Predicting the Effects of Missense Mutations in Human Cancers. BMC Genomics, 14, S7.</mixed-citation></ref><ref id="scirp.76090-ref10"><label>10</label><mixed-citation publication-type="other" xlink:type="simple">Reva, B., Antipin, Y. and Sander, C. (2011) Predicting the Functional Impact of Protein Mutations: Application to Cancer Genomics. Nucleic Acids Res, 39, e118. https://doi.org/10.1093/nar/gkr407</mixed-citation></ref><ref id="scirp.76090-ref11"><label>11</label><mixed-citation publication-type="other" xlink:type="simple">Dehouck, Y., Kwasigroch, J.M., Rooman, M. and Gilis, D. (2013) BeAtMuSiC: prediction of Changes in Protein-Protein Binding Affinity on Mutations. Nucleic Acids Res, 41, W333–339. https://doi.org/10.1093/nar/gkt450</mixed-citation></ref><ref id="scirp.76090-ref12"><label>12</label><mixed-citation publication-type="other" xlink:type="simple">Kumar, P., Henikoff, S. and Ng, P.C. (2009) Predicting the Effects of Coding Non-Synonymous Variants on Protein Function Using the SIFT Algorithm. Nature Protocols, 4, 1073–1081. https://doi.org/10.1038/nprot.2009.86</mixed-citation></ref><ref id="scirp.76090-ref13"><label>13</label><mixed-citation publication-type="other" xlink:type="simple">Dehouck, Y., Kwasigroch, J.M., Gilis, D. and Rooman, M. (2011) PoPMuSiC 2.1: A Web Server for the Estimation of Protein Stability Changes upon Mutation and Sequence Optimality. BMC Bioinformatics, 12,151. 
https://doi.org/10.1186/1471-2105-12-151</mixed-citation></ref><ref id="scirp.76090-ref14"><label>14</label><mixed-citation publication-type="other" xlink:type="simple">Adzhubei, I.A., Schmidt, S., Peshkin, L., Ramensky, V.E., Gerasimova, A., Bork, P., et al. (2010) A Method and Server for Predicting Damaging Missense Mutations. Nat Methods, 7, 248–249. https://doi.org/10.1038/nmeth0410-248</mixed-citation></ref><ref id="scirp.76090-ref15"><label>15</label><mixed-citation publication-type="other" xlink:type="simple">Song, Y. X., Zhou, X., Wang, Z., Gao, P., Li, A.L., et al. (2012) The Association be-tween Individual SNPs or Haplotypes of Matrix Metalloproteinase 1 and Gastric Cancer Susceptibility. Progression and Prognosis, 7, e 38002.</mixed-citation></ref><ref id="scirp.76090-ref16"><label>16</label><mixed-citation publication-type="other" xlink:type="simple">Hamosh, A., Scott, A.F. Amberger, J.S., Bocchini, C.A. and McKusick, V.A. (2005) Online Mendelian Inheritance in Man (OMIM), a Knowledgebase of Human Genes and Genetic Disorders. Nucleic Acids Research, 33, D514–D517.  
https://doi.org/10.1093/nar/gki033</mixed-citation></ref><ref id="scirp.76090-ref17"><label>17</label><mixed-citation publication-type="other" xlink:type="simple">Szklarczyk, D., Franceschini, A., Kuhn, M., Simonovic, M., Roth, A., Minguez, P., et al. (2011) The STRING Database in 2011: Functional Interaction Networks of Proteins, Globally Integrated and Scored. Nucleic Acids Res, 39, D561–8.  
https://doi.org/10.1093/nar/gkq973</mixed-citation></ref><ref id="scirp.76090-ref18"><label>18</label><mixed-citation publication-type="other" xlink:type="simple">Bairoch, A. and Apweiler, R. (2000) The SWISS-PROT Protein Sequence Database and Its Supplement TrEMBL in 2000. Nucleic Acids Res, 28, 45–48.  
https://doi.org/10.1093/nar/28.1.45</mixed-citation></ref><ref id="scirp.76090-ref19"><label>19</label><mixed-citation publication-type="other" xlink:type="simple">Schymkowitz, J., Borg, J., Stricher, F., Nys, R., Rousseau, F. and Serrano, L. (2005) The FoldX Web Server: An Online Force Field. Nucl. Acids Res, 33 W382–8. https://doi.org/10.1093/nar/gki387</mixed-citation></ref><ref id="scirp.76090-ref20"><label>20</label><mixed-citation publication-type="other" xlink:type="simple">Shihab, H.A., Gough, J., Cooper, D.N., Day, I.N.M. and Gaunt, T.R. (2013) Predicting the Functional Consequences of Cancer-Associated Amino Acid Substitutions. Bioinformatics, 29,1504-1510. https://doi.org/10.1093/bioinformatics/btt182</mixed-citation></ref><ref id="scirp.76090-ref21"><label>21</label><mixed-citation publication-type="other" xlink:type="simple">Thomas, P.D., Kejariwal, A., Guo, N., Mi, H.Y. and Campbell, M.J., Muruganujan, A. and Lazareva-Ulitsky, B. (2006) Applications for Protein Sequence-Function Evolution Data: mRNA/protein Expression Analysis and Coding SNP Scoring Tools. Nucl. Acids Res, 34, W645-W650. https://doi.org/10.1093/nar/gkl229</mixed-citation></ref><ref id="scirp.76090-ref22"><label>22</label><mixed-citation publication-type="other" xlink:type="simple">Breiman, L. (2001) Random Forests. Machine Learning, 45, 5–32.  
https://doi.org/10.1023/A:1010933404324</mixed-citation></ref><ref id="scirp.76090-ref23"><label>23</label><mixed-citation publication-type="other" xlink:type="simple">Cortes, C. and Vapnik, V. (1995) Support Vector Machine. Machine Learning, 20, 273-297. https://doi.org/10.1023/A:1022627411411</mixed-citation></ref><ref id="scirp.76090-ref24"><label>24</label><mixed-citation publication-type="other" xlink:type="simple">Stein, A. and Aloy, P. (2010) Novel Peptide-Mediated Interactions Derived from High-Resolution 3-dimensional Structures. PloSComput. Biol, 6, e1000789.  
https://doi.org/10.1371/journal.pcbi.1000789</mixed-citation></ref><ref id="scirp.76090-ref25"><label>25</label><mixed-citation publication-type="other" xlink:type="simple">Thorisson, G.A., Smith, A.V., Krishnan, L. and Stein, L.D. (2005) The International Hap Map Project Website. Genome Res, 15, 1592-1593.  
https://doi.org/10.1101/gr.4413105</mixed-citation></ref><ref id="scirp.76090-ref26"><label>26</label><mixed-citation publication-type="other" xlink:type="simple">Kent, W.J., Sugnet, C.W., Furey, T.S., Roskin, K.M., Pringle, T.H., Zahler, A.M. and Haussler, D. (2002) The Human genome browser at UCSC. Genome Res, 12, 996-1006. https://doi.org/10.1101/gr.229102</mixed-citation></ref><ref id="scirp.76090-ref27"><label>27</label><mixed-citation publication-type="other" xlink:type="simple">McVean, et al. (2012) An Integrated Map of Genetic Variation from 1092 Human Genomes. Nature, 491, 56-65. https://doi.org/10.1038/nature11632</mixed-citation></ref><ref id="scirp.76090-ref28"><label>28</label><mixed-citation publication-type="other" xlink:type="simple">Hanley, J. and McNeil, B. (1982) The Meaning and Use of the Area under a Receiver Operating Characteristics (ROC) Curve. Radiology, 143, 29-36.  
https://doi.org/10.1148/radiology.143.1.7063747</mixed-citation></ref></ref-list></back></article>