Unconfigured Ad

Collapse
X
 
  • Filter
  • Time
  • Show
Clear All
new posts
  • homonecloco
    Junior Member
    • May 2010
    • 1

    Tophat not

    Hello everybody,

    I'm new to the forum, I had found it useful before, because many of the problems I had, someone already had a similar problem before, but this time I'm a little bit more stuck than usually.

    I'm trying to do some differential expression analysis with cufflinks, tophat and bowtie. However, at the moment we don't have a complete reference of the organism, so we are trying to use a partial assembly as reference. The software seems to do all the bowtie alignments, but samtools view files at some point in the pipeline. I found in run.log that the last executed command was

    samtools view -S -b /tmp/lane_1//tmp/accepted_hits.sam > /tmp/lane_1//tmp/fileZvx32H

    So, I executed again that command manually, and the output was t he following:

    [samopen] SAM header is present: 25828 sequences.
    Parse error at line 1963402: CIGAR and sequence length are inconsistent
    /usr/users/tgac/ramirezr/.lsbatch/1290771421.40646: line 8: 16759 Aborted (core dumped) samtools view -S -b lane_1/tmp/accepted_hits.sam > lane_1/tmp/fileZvx32H


    So, I went to line 1963402 in accepted_hits.sam, and I found the following:

    N73018:1:7:6056:18003#0 99 30063 392907 255 104M178N536870906M138N22M = 393405 0 TGGAGGAGCAGGAACCTCTGGGGCCAAATCTTCCCGCTCTTCACGATCATTACCAACAGCTTCATCATCATCGGTGAAAATTTCTTCATGCTCCCAATCATCACCCTTCTCAATATCATC GFEEGGGGGGGGGGGGGADGEE-FEGFGGGGFGGFGAFGGEEFGGAGDGEFGE@GGFDEFGBGEGEEGGEEBEDAEBDDBEGEFFBEEFE=AD@AB=EEBDEDD@FABBBE=@AE:???? NM:i:255 XS:A:- NH:i:1

    I can see tha the CIGAR 104M178N536870906M138N22M is something completely unexpected. Then I looked in the read files and the reads look ok for both pairs.


    @N73018:1:7:6056:18003#0/1
    TCCCGCTCTTCACGATCATTACCAACAGCTTCATCATCATCGGTGAAAATTTCTTCATGCTCCCAATCATCACCCTTCTCAATATCATC
    +
    GFEEGGGGGGGGGGGGGADGEE-FEGFGGGGFGGFGAFGGEEFGGAGDGEFGE@GGFDEFGBGEGEEGGEEBEDAEBDDBEGEFFBEEFE=AD@AB=EEBDEDD@FABBBE=@AE:????

    @N73018:1:7:6056:18003#0/2
    GAGCAGCTAGTGGAAGGGGACGTAAAAAGGCAGCTGGTGACGATGAAGAAGGTAATGTATCTGACAGAGGAGACGAAGATGAGGAAGAGGAGGCAGCAAGGAAGAATAGACTTGGAATCA
    +
    4463292 DDGGEFFFFFBEEAEEEEE=BEE?EFFFBFBBE::EEBBAEFAFF:=BB?CE?BCBC5:B@EBBEBEBEBBEBAE@@E:BB:BB+5>>>>=BBB?B??,=<,<<<5????5?=5?%%%%%


    Then, I went to the reference, to the read 30063 and I did found that the sequences in the CIGAR is there, not in a single hit, but in three, all of them close within each other, at first I thought it could be that the alignment may be split between regions with Ns, but it isn't. This is part of the scaffold where the alignment occurs. So far, it seems ok.

    >30063
    TGATTCATCAAACAATACGATTTACAGTCGAAGGACCAGGATTTTGATATTCCGTGCAAA
    ATACTCCTTTAGTTCACAATAAACAGGCCCTTGAAACTTACAGTTTCTTTCTATTAGTGG
    ATTAATGATCAATTAGATCGTGCTCCTTTTAATTGTTGAATCCTAATTTGGAAATAGTTG
    CAATCTTATCCTATAAGTAAAGATTTTGAAAAAGAATATTATTAATCTAACCGAAGAAAA
    ATATTAATATTAATTTTTTTTGTTATTTCTTTCCACCCCACCCTTTCTCAGCCCAACTCT
    GATTAGTTACAAAATATCATTTTTAAAATCAACTTTAATAAAATCCTAATTTGGGATATA
    ATTGATACATAGGCCTTTACTTTTCATCAAAGAAAGCAAAATGCACTATAAATACTTCTG
    AATATTGAAACCAATTGACACCCAAATGTTAAGTTTCAATTTAACTCCTAAGTTTTGGAA
    CCAGTTGATAAATGTCTTCAGATACAAAAGTGAAAAATGGCAGACATTAATAACTTGCAA
    AAACAAATACAAACCTGCTTGATTTCTGGAGGAGCAGGAACCTCTGGGGCCAAATCTTCC
    CGCTCTTCACGATCATTACCAACAGCTTCATCATCATCGGTGAAAATTTCTTCATGCTCC
    CAATCATCACCTAAAATCAACAAATATACATTTCTAAAGTGAAAATCACTTGAAAAACTA
    AATTAAAGATTACACTTTATACAATTTTTTTTTTAAAAAAAAAAAAGAAAAAGAAGTTTC
    ATCCGTGTCAGCATCTGTCAAGCTTATTGAACCAGGAAAGATGATTGCAAAACCTTTTCC
    ATGTACACCAAAAAGAAGAGAATGCCACCCCTTGAGCACATAAGCAGGATCAATATAAGA
    ATGCATAAGAAATCAGTAGTTATTTGTAGATTCAAACTCCTAAAATAAAAAAGCATTAGG
    ACATCATACTGAAGAGAAATGCTCACCCTTCTCAATATCATCATCATCAATATCGTGATC
    TCCTCCCCTTGGACCTTCCTCATCATCATCACCACCACGCTTGTTGAGTCCAAGTCTATT
    CTTCCTTGCTGCCTCCTCTTCCTCATCTTCGTCTCCTCTGTCAGATACATTACCTTCTTC
    ATCGTCACCAGCTGCCTTTTTACGTCCCCTTCCACTAGCTGCTCCACTGTCCTTATCATC
    AAGCTTCTCCACTTCACCAAATGCAGCGGGTCCATTATTGGCAGCTTTCATCATCCATCT
    CTCATATCCATCTGCAGTCTTTCTCCTGTTCCTCATCTTCTCTTCCGCTTCCTCCAAAGT
    GAGTTGCTTATACTGAGCAACTTTATTAAAATTATACCTATGAAACATGTCAAGCAATTT
    ACAACTTCAATTCTAAAAAGACAGTTAACATTACATCATCAAATTATCTTGCAAATGGGT
    GAGTAGACAATTTTAAATGAAAAAAAAAAAAAATCTATGTCCTTGTAGGACAATCATTTC
    CAGAATAAAACAAACAAGTAGGTAGGTAAAATGGGACGCCAAGTCGAAAAGTATTCTGCG
    CAGTATTTACAAGAGGGAAGAGCATATAGCCCGAATAAAAGAAGCATGGAGAGTACCAAG
    AAGAAGCAGGAATAGCAACAAACTCTTTCCCCTGCAAGATCAATAGGTAGTAAGTTGCTG
    ATTGTGAACCTTCGAGATGACCTTGGTACTGAAACTGGCCTGTTTCATCCTCCAGGAGCC
    AAGGTCTGTTCTTGTATTTCTCCTATAAAATGCAATTACAAATAGCAGTAAGTAGAATGC
    AGTGACATTCAGATTTTGATTAGTTGAGTGATTCTTTAGTCCAAGCCAAATAATCTTTAC
    CAAAGGGAAAGAAATAGAACAGCACTGAGTACAGTAAGTAAAAGGTACCCGCAAGGCATC
    AGTAAGTTGACGTCCTTGAAGACCTTCTTTTTGAAGAGACCATTTGTTCTCAGCATTTTT
    TTTCTTAGAAAAACTCGGTAGACCCGTAACAAACCTACCAATAAAGTAGTTCTTGTCGCT
    GCTAGAACTTGCTCTAACATTATATTCCTAACAAAACCAAAAAAAATTAAAAGAAATAGA
    CATGCAAATTGAGAGCAGAAAAAGGGAGAGGGAGGCTGACCCGAATCAAGCGAGAGACAG
    TAGCACCACAATCAAAGCATTTAGCATGATTTTCAGCCATGGTTTTGCCACAAGACAAGC
    ACAATGTCATGTGCTTGCAGTTGCTTCCGTATAAGTCGGTGGTTGATCCACATCCACTAC
    ATGACCCTTTCAGCATCAGATCCATAGTCGCCATTTCTCTTTTATTTATTTATTTATTTA


    thanks for your help
    Ricardo.

Latest Articles

Collapse

  • SEQadmin2
    Proteomic Platforms: How to Choose the Right Analytical Strategy to Improve Detection and Clinical Applications
    by SEQadmin2


    Proteomics platforms are evolving rapidly, with advances in mass spectrometry and affinity-based approaches expanding what researchers can detect and at what scale. As the field moves toward deeper proteome coverage and clinical applications, scientists face an increasingly complex landscape of tools. This article will explore how researchers are navigating these choices to find the right platform for their work.

    The systematic characterization of the human proteome has
    ...
    Yesterday, 11:48 AM
  • SEQadmin2
    Advanced Sequencing Platforms Tackle Neuroscience’s Toughest Genomics Problems
    by SEQadmin2



    Genomics studies in neuroscience face a special challenge due to the brain’s complexity and scarcity of samples. Mapping changes in cell type and state using conventional next-generation sequencing methods remains challenging. Advances in technologies like single-cell sequencing, spatial transcriptomics, and long-read sequencing have opened the door to deeper studies of the brain and diseases like Alzheimer’s, amyotrophic lateral sclerosis (ALS), and schizophrenia.
    ...
    07-09-2026, 11:10 AM
  • SEQadmin2
    Cancer Drug Resistance: The Lingering Barrier to Rising Survival
    by SEQadmin2



    Cancer survival rates have significantly increased in the last few decades in the United States, reaching a combined 70% 5-year survival rate by 2021. Behind this number, there are years of research to find new therapies, drug targets, and early detection methods. But there is one core challenge that keeps slowing down these advances, and it’s about drug resistance.

    There is no single reason why many patients don’t respond to treatment as expected. Cancer is...
    07-08-2026, 05:17 AM

ad_right_rmr

Collapse

News

Collapse

Topics Statistics Last Post
Started by SEQadmin2, Yesterday, 11:10 AM
0 responses
9 views
0 reactions
Last Post SEQadmin2  
Started by SEQadmin2, 07-13-2026, 10:26 AM
0 responses
30 views
0 reactions
Last Post SEQadmin2  
Started by SEQadmin2, 07-09-2026, 10:04 AM
0 responses
40 views
0 reactions
Last Post SEQadmin2  
Started by SEQadmin2, 07-08-2026, 10:08 AM
0 responses
25 views
0 reactions
Last Post SEQadmin2  
Working...