Bioinformaticsで使うファイルフォーマットまとめ
バイオインフォマティクスで障壁になることの1つにファイルフォーマットが多すぎるという問題があります。ツールを動かそうとするとこれとこれが必要、どうやってこの形式のファイルを作ればいいんだ、ということはよくあるので、備忘録を兼ねてよく使うフォーマットと関連ツールをまとめておきます。
バイオインフォマティクスで障壁になることの1つにファイルフォーマットが多すぎるという問題があります。ツールを動かそうとするとこれとこれが必要、どうやってこの形式のファイルを作ればいいんだ、ということはよくあるので、備忘録を兼ねてよく使うフォーマットと関連ツールをまとめておきます。
GO解析はよく使われる解析手法ですが、正確に理解するには、まずGOそのものに関する理解が必要になります。GO Termの基本についてまとめていきます。
RにはGO Enrichmentの結果をいい感じに図示してくれるライブラリがいくつかありますが、Pythonにはありません。基本的なプロットからsemantic similarityを利用したheatmap・MDS scatter・ネットワーク・treemapまで、似たような図の作成方法をまとめます。
遺伝子やタンパク質に関連する多様なデータベース間でのID変換方法を解説します。特に、UniprotのID Mappingサービスを使えば、Uniprot IDからEnsembl ID、NCBIのEntrez IDなど、主要なデータベース間での変換が簡単に行えます。APIも提供されているため、スクリプトやプログラムでの自動化も可能です。さらに、APIの利用方法や実際のコマンド例についても触れています。 このページでは、IDマッピングの手順を詳しく説明し、実際のコマンド例を含めた具体的な手順を紹介しています。APIを用いたプロセスをステップごとに説明しており、UniprotKBからUniRefへの変換、Ensemblへの変換例を取り上げています。
Phylogenetic Analysis各種ステップのAlignment, Trim, Model選択, Tree Constructionに関する情報、ツールに関してまとめ
genomic sequenceと少しRNA-seqのパイプラインは違うので、bestpracticeをbashで実行するメモ
single cell RNA-seqを知ってる人ならまず知っているであろう、Cell Ranger。使ったことがなかったんですが、ちょっと使ってみようかなと思いました。しかし、これ内部的にはSTARを使ってマッピングするんですが、STARのパラメーターを引数でとれない、という問題(誰も問題にしていない)があります。公式の解答としては、自分でビルドしてね、責任は持たないけど、ってことらしいです。
遺伝子の機能や、進化を考察する上でタンパク質を用いた系統解析は重要な解析手法の一つとして知られている。今回は、MUSCLEを用いてマルチプルアラインメントを作成し、非保存領域をTrimAlで除去したあと、RAxMLを用いて最尤法によって系統解析を行う。
salmonの出力ファイルはquant.sfですが、その加工は非常に多岐に渡り、結構難しいです。tximportで加工できる先と用途についてまとめていきたいと思います。