ラベル 配列解析 の投稿を表示しています。 すべての投稿を表示
ラベル 配列解析 の投稿を表示しています。 すべての投稿を表示

Perlのエラーを直す

Perlの実行時に、以下のような警告が出て邪魔です。これは、調べたところ、ログインしているMacのbashの環境設定が、Ubuntu内で反映しているのが問題だそうです。

perl: warning: Setting locale failed.
perl: warning: Please check that your locale settings:
LANGUAGE = (unset),
LC_ALL = (unset),
LC_CTYPE = "UTF-8",
LANG = "ja_JP.UTF-8"
    are supported and installed on your system.

perl: warning: Falling back to a fallback locale ("ja_JP.UTF-8").

そこで、Ubuntuの~/.bashrcの末尾に

export LC_ALL=en_US.UTF-8

を追加するとうまくいきます。

OSのイメージを仮想アプライアンスとして出力

他のパソコンのVirtualboxへ現在のパソコンのVIrtualbox内のUbuntuを移植したい場合、仮想アプライアンスとして出力がおすすめです。OVAファイルが生成されますので、それをインポートすればよいです。

Virtualboxのスナップショット

Virtualboxはその瞬間の設定すべての差分を記録することができます。それがスナップショットというシステムです。OSを選択するウィンドウで、Spanpshotを選択すれば、スナップショットを作成できます。
重大な設定変更を行う前にはスナップショットを作成することをお勧めします。

Ubuntu15.04へBioperlをインストール

Bioperlはプラットフォームごとに様々なインストール方法が存在する。
一番、conservativeな方法はソースコードからのビルドだが、ハマるポイントも多い。
UbuntuはAPTでパッケージとしてインストールが可能なため、それに頼るとする。

$ sudo apt-get install bioperl

こちら(http://www.bioperl.org/wiki/Getting_Started)を参考にして、テストを行う。
以下のファイルをtest.plとでも作っておく。

use Bio::Seq;
use Bio::SeqIO;

# create a sequence object of some DNA
my $seq = Bio::Seq->new(-id => 'testseq', -seq => 'CATGTAGATAG');

# print out some details about it
print "seq is ", $seq->length, " bases long\n";
print "revcom seq is ", $seq->revcom->seq, "\n";

# write it to a file in Fasta format
my $out = Bio::SeqIO->new(-file => '>testseq.fsa', -format => 'Fasta');
$out->write_seq($seq);


その後、

$ perl test.pl
$ ls      
test.pl  testseq.fsa
$ less testseq.fsa
>testseq
CATGTAGATAG

問題なく動いているようである。

Virtualbox内のUbuntuにNATのポートフォワーディングによりSSH接続する

# sshサーバーをインストール
$ sudo apt-get install ssh


Ubuntuを選択して、Setting内のNetwork内のAdapter1を選択。初期設定はNATとなっているはず。Advanceを選択すると、ポートフォワーディングができる。私は以下のようにした。



ホストのMacより以下のようにコマンドをうって、Virtualbox内のUbuntuへログインできる。
$ ssh -P 2222  kappa@localhost

Ubuntu15.04をインストールしてからすぐに行うこと

#自分のユーザー所有のフォルダ名を英語に変更
$ LANG=C xdg-user-dirs-gtk-update
$ sudo reboot


#以下のコマンド3つてCUI起動になります。grubの設定ファイルを書き換えていたかつてとは異なる部分ですので注意が必要です
$  systemctl get-default
$ sudo systemctl set-default multi-user.target
$ sudo reboot

今後、都合が悪くなれば設定を追加します。

OS X Yosemite上のVirtualbox5.0.4にUbuntu15.04をインストール

Bioperlを一通り勉強しようと思い至ったため、表題の通りOS X Yosemite上のVirtualbox5.0.4にUbuntu15.04をインストールしました。


ClustalWを用いてマルチプルアラインメントを作成する

ClustalxとはGUIベースのマルチプルアラインメントソフトウェアです。今回は、ヒト、マウス、ゼブラフィッシュのrhodopsinのアミノ酸配列のアラインメントを行いたいと思います。

########ClustalX2.1のダウンロード###########

以下のサイトからclustalxのmac用のバイナリファイルをダウンロードして開きます。(clustalx-2.1-macosx.dmg)
http://www.clustal.org/clustal2/#Download

clustalx-2.1-macosx.dmgダブルクリックすると開いたフォルダの中にclustalx.appが入っているので、/Applicationsにコピーします
$ cp -r ~/Desktop/clustalx.app /Applications

clustalxを起動するにはopenコマンドを使用します。
$ open -a clustalx



########マルティプルアラインメントの作成##########

次にrhodopsinのアミノ酸配列を記述した次の配列ファイルを読み込みます。



$ cat rho.fasta
>gi|4506527|ref|NP_000530.1| rhodopsin [Homo sapiens]
MNGTEGPNFYVPFSNATGVVRSPFEYPQYYLAEPWQFSMLAAYMFLLIVLGFPINFLTLYVTVQHKKLRT
PLNYILLNLAVADLFMVLGGFTSTLYTSLHGYFVFGPTGCNLEGFFATLGGEIALWSLVVLAIERYVVVC
KPMSNFRFGENHAIMGVAFTWVMALACAAPPLAGWSRYIPEGLQCSCGIDYYTLKPEVNNESFVIYMFVV
HFTIPMIIIFFCYGQLVFTVKEAAAQQQESATTQKAEKEVTRMVIIMVIAFLICWVPYASVAFYIFTHQG
SNFGPIFMTIPAFFAKSAAIYNPVIYIMMNKQFRNCMLTTICCGKNPLGDDEASATVSKTETSQVAPA

>gi|21717805|ref|NP_663358.1| rhodopsin [Mus musculus]
MNGTEGPNFYVPFSNVTGVVRSPFEQPQYYLAEPWQFSMLAAYMFLLIVLGFPINFLTLYVTVQHKKLRT
PLNYILLNLAVADLFMVFGGFTTTLYTSLHGYFVFGPTGCNLEGFFATLGGEIALWSLVVLAIERYVVVC
KPMSNFRFGENHAIMGVVFTWIMALACAAPPLVGWSRYIPEGMQCSCGIDYYTLKPEVNNESFVIYMFVV
HFTIPMIVIFFCYGQLVFTVKEAAAQQQESATTQKAEKEVTRMVIIMVIFFLICWLPYASVAFYIFTHQG
SNFGPIFMTLPAFFAKSSSIYNPVIYIMLNKQFRNCMLTTLCCGKNPLGDDDASATASKTETSQVAPA

>gi|18859317|ref|NP_571159.1| rhodopsin [Danio rerio]
MNGTEGPAFYVPMSNATGVVRSPYEYPQYYLVAPWAYGFVAAYMFFLIITGFPVNFLTLYVTIEHKKLRT
PLNYILLNLAIADLFMVFGGFTTTMYTSLHGYFVFGRLGCNLEGFFATLGGEMGLKSLVVLAIERWMVVC
KPVSNFRFGENHAIMGVAFTWVMACSCAVPPLVGWSRYIPEGMQCSCGVDYYTRTPGVNNESFVIYMFIV
HFFIPLIVIFFCYGRLVCTVKEAARQQQESETTQRAEREVTRMVIIMVIAFLICWLPYAGVAWYIFTHQG
SEFGPVFMTLPAFFAKTSAVYNPCIYICMNKQFRHCMITTLCCGKNPFEEEEGASTTASKTEASSVSSSS



1)ファイルのロード
File -> Load sequence
でファイルを選択。
2)マルティプルアラインメントの実行
Alignment -> Do complete Alignment
3)アラインメントの画像を出力
File -> Write alignment as postscript

以下の画像は結果を一部切り出しています。




Macにblast+をインストール

snow leopardの環境でblast+をインストールしてみます。

#まずは、ncbiのftpサイトからバイナリファイルをダウンロードしてきます。

$ curl -O ftp://ftp.ncbi.nlm.nih.gov/blast/executables/blast+/2.2.26/ncbi-blast-2.2.26+.dmg

#インストーラーの起動
$ open ncbi-blast-2.2.26+.dmg

#データベース構築のための準備

$ mkdir ~/blast
$ cd ~/blast
$ mkdir db
$ cd db

#ncbiのftpサーバーから、zebrafishのmRNAのRefseqの情報を取得する。
$ ftp ftp.ncbi.nlm.nih.gov
# usernameはanonymous です。passwordはmail addressです。
> cd ./refseq/D_rerio/mRNA_Prot
> get zebrafish.rna.fna.gz
> quit

#ダウンロードしたファイルを解凍
$ gunzip zebrafish.rna.fna.gz

#解凍したファイルの中身を確認
$ less zebrafish.rna.fna

#データベースを作成(zebrafish.rnaとする)
$ makeblastdb -in zebrafish.rna.fna -out zebrafish.rna -dbtype nucl -hash_index
# ~/blast/dbに先ほど作成したデータベースに関係するバイナリファイルが生成しているか確認する。
a$ ls -l
total 161072
-rw-r--r--  1 kappa  staff  61601369  9 18 06:23 zebrafish.rna.fna
-rw-r--r--  1 kappa  staff    463168  9 18 23:49 zebrafish.rna.nhd
-rw-r--r--  1 kappa  staff     10816  9 18 23:49 zebrafish.rna.nhi
-rw-r--r--  1 kappa  staff   4681996  9 18 23:49 zebrafish.rna.nhr
-rw-r--r--  1 kappa  staff    340056  9 18 23:49 zebrafish.rna.nin
-rw-r--r--  1 kappa  staff    113356  9 18 23:49 zebrafish.rna.nog
-rw-r--r--  1 kappa  staff    714386  9 18 23:49 zebrafish.rna.nsd
-rw-r--r--  1 kappa  staff     14750  9 18 23:49 zebrafish.rna.nsi
-rw-r--r--  1 kappa  staff  14506797  9 18 23:49 zebrafish.rna.nsq

#ホームディレクトリに設定ファイル(.ncbirc)を作る
$ ~/.ncbirc


; Start the section for BLAST configuration
[BLAST]
; Specifies the path where BLAST databases are installed
BLASTDB=/Users/kappa/blast/db
; Specifies the data sources to use for automatic resolution
; for sequence identifiers
DATA_LOADERS=none
; Specifies the BLAST database to use resolve protein sequences
;BLASTDB_PROT_DATA_LOADER=nr
; Specifies the BLAST database to use resolve protein sequences
;BLASTDB_NUCL_DATA_LOADER=nt
; Windowmasker settings (experimental)
[WINDOW_MASKER]
WINDOW_MASKER_PATH=/Users/kappa/blast/db/windowmasker
; end of file


#これで設定完了
#tp53のmRNAの配列をblastにかけてみる。
$ head tp53.fasta

>gi|18859502|ref|NM_131327.1| Danio rerio tumor protein p53 (tp53), mRNA
GTTTAGTGGAGAGGAGGTCGGCAAAATCAATTCTTGCAAAGCAATGGCGCAAAACGACAGCCAAGAGTTC
GCGGAGCTCTGGGAGAAGAATTTGATTATTCAGCCCCCAGGTGGTGGCTCTTGCTGGGACATCATTAATG
ATGAGGAGTACTTGCCGGGATCGTTTGACCCCAATTTTTTTGAAAATGTGCTTGAAGAACAGCCTCAGCC
ATCCACTCTCCCACCAACATCCACTGTTCCGGAGACAAGCGACTATCCCGGCGATCATGGATTTAGGCTC
AGGTTCCCGCAGTCTGGCACAGCAAAATCTGTAACTTGCACTTATTCACCGGACCTGAATAAACTCTTCT
GTCAGCTGGCAAAAACTTGCCCCGTTCAAATGGTGGTGGACGTTGCCCCTCCACAGGGCTCCGTGGTTCG
AGCCACTGCCATCTATAAGAAGTCCGAGCATGTGGCTGAAGTGGTCCGCAGATGCCCCCATCATGAGCGA
ACCCCGGATGGAGATAACTTGGCGCCTGCTGGTCATTTGATAAGAGTGGAGGGCAATCAGCGAGCAAATT
ACAGGGAAGATAACATCACTTTAAGGCATAGTGTTTTTGTCCCATATGAAGCACCACAGCTTGGTGCTGA

$ blastn -db zebrafish.rna -query tp53.fasta  -out blast.out

$ less blast.out