2019年5月3日金曜日

スクリーンショットショートカットキー(Win10)

  • アクティブ画面キャプチャ+ファイル保存:❖+Alt+PrtSc
  • 全画面キャプチャ+ファイル保存    :❖+PrtSc
  • 指定範囲キャプチャ(ファイル保存しない) :❖+Shift+S
  • クリップボード履歴          :❖+V
※1 ❖:Windowsロゴキー
※2 これらのショートカットキーはWin10のバージョンによって使えないものがあるようです。

2018年10月26日金曜日

【Linux】時刻を1分進める・1時間進める・1日進める【date】

●30秒進める

date -s "`date '+%Y/%m/%d %H:%M:%S' -d '30 second'`"

●1時間進める

date -s "`date '+%Y/%m/%d %H:%M:%S' -d '1 hour'`"

●59分進める

date -s "`date '+%Y/%m/%d %H:%M:%S' -d '59 minute'`"

●1日進める

date -s "`date '+%Y/%m/%d %H:%M:%S' -d '1 day'`"

●1カ月進める

date -s "`date '+%Y/%m/%d %H:%M:%S' -d '1 month'`"

●1年進める

date -s "`date '+%Y/%m/%d %H:%M:%S' -d '1 year'`"

●30秒戻す

date -s "`date '+%Y/%m/%d %H:%M:%S' -d '-30 second'`"

●1分戻す

date -s "`date '+%Y/%m/%d %H:%M:%S' -d '-1 minute'`"

●1時間戻す

date -s "`date '+%Y/%m/%d %H:%M:%S' -d '-1 hour'`"

●1年戻す

date -s "`date '+%Y/%m/%d %H:%M:%S' -d '-1 year'`"

●実行画面



【Linux】時計2【コマンド】

while : ; do sleep 1; clear ; date ;done

●実行前


●実行中


●停止方法
Ctrl+Cで停止する。

●解説
無限ループで以下を実行する。
・1秒待ち
・画面クリア
・現在日時表示

while ~ do doneはループ。
:(コロン)は何もしないコマンド。
;(セミコロン)はコマンドを連続して実行する(複数のコマンドをセットとして実行する)。

2018年10月25日木曜日

【tcpdump】TCP Retransmission発生【Linux】

本来はそこまで気にしなくていいかもしれないが、tcpdumpで取得したパケットキャプチャをWiresharkで見たら、パケットが黒だらけ。

TCPのSYNがTCP Retransmission(TCPレベルのリトライ)となっていた。初回のアクセスを0秒として
1秒後(前のパケットから1秒後)
3秒後(前のパケットから2秒後)
7秒後(前のパケットから4秒後)
15秒後(前のパケットから8秒後)
31秒後(前のパケットから16秒後)
とリトライをしていた。※1

クライアントがサーバに対してSYNを送信し、その応答としてサーバがクライアントにSYN ACKを返すはずだが、それが返されないため(ネットワークのどこかでパケットがドロップした※2)、クライアントの(OSが自動的に)SYNを再送していた。で、結局31秒後の再送でやっとSYN ACKが返されて通信は無事に終わった。

ネットワーク部門は別会社のため、聴くことはできず、原因が不明のまま…

※1 使用していたのはCentOSで、リトライの回数・間隔はOSによって変わる。
※2 原因不明。

【PowerShell】1ファイルずつzip圧縮【Compress-Archive】

●拡張子指定
dir *.txt | % { compress-archive $_ ($_.basename + ".zip")}

●全ファイル
dir | % { compress-archive $_ ($_.basename + ".zip")}

●パス指定
 dir c:\wk\tmp\ | % { compress-archive $_ ($_.basename + ".zip")}

●解説
%はforeachのエイリアス(別名)
compress-archiveは圧縮コマンド
$_はforeachで取り出される変数
basenameは拡張子を取り除いたファイル名

●拡張子指定した場合


●以下のようになる。



2018年10月15日月曜日

【Java】301 moved parmanently 【HttpClient】

ある日突然JavaのWebアプリ内のWebアクセスのログに、 301 moved parmanentlyが出た。該当のWebページがページを移転したようだ。
Webアプリでは、apache commons HttpClientを使用していて、このライブラリは自動でリダイレクトをしてくれるため、特に対処不要だった。
JavaのWebアクセスって3~4行で簡単に出来るから自分で実装してしまいがちだが、やっぱりライブラリ使った方が安全だった。

2018年10月11日木曜日

【tcpdump】週単位でファイル上書きローテーション【Linux】

sudo tcpdump -i eth0 -s 0 -Z user -G 3600 -w dmp_%a_%H.pcap -z ./gzf.sh
tcpdump -i eth0 -s 0 G 3600 -Z root -w dmp_%a_%H.pcap -z ./gzf.sh
など

●解説

  • -G:3600を指定しているため、1時間毎にファイルが生成される。ファイルのタイムスタンプとして、曜日(%a)と時間(%H)を指定するため、1週間毎にローテーションされる。%aの代わりに%uを指定しても良い。1月ローテーションにする場合は、%d_%Hまたは、%dなどにする。
  • -Z user:実行するユーザー。実在するユーザを指定する。
  • -z gzf.sh:圧縮&上書き時にプロンプトを表示しない。プロンプトが表示されてしまうと、tcpdumpが異常終了してしまうため、強制上書きオプションを指定する。

●gzf.sh

#!/bin/sh
/bin/gzip -f ${1}

●事前作業

ファイル名のタイムスタンプが必要なため、perl-DateTimeが必要。当然、tcpdumpも必要。
yum install perl-DateTime
yum install tcpdump

●手順

echo '#!/bin/sh' > gzf.sh
echo '/bin/gzip -f ${1}' >> gzf.sh
chmod 777 gzf.sh
tcpdump -i ens192 -s 0 -G 3600 -w dmp_%a_%H.pcap -z ./gzf.sh -Z root

●実行



●実行中画面

①取得開始直後(8時)


②1時間後(9時)


③2時間後(10時)


④次の日


⑤1週間以上経過



2018年10月4日木曜日

【tcpdump】Permission denied【Linux】

CentOSの話だが、-Gオプションを付けて定期的に別ファイルに書き込む事が出来る(簡易的なファイルローテーションで削除はされない)。
この際、-Zでユーザーを指定しないとローテーションする際にPermission deniedが出て異常終了してしまう。

2018年10月2日火曜日

【Linux】スクリプトファイル指定にすれば早い【sed】

約3.0GBのファイルを置換をした。
対象の置換前文字列は、数十行。
sedコマンドを一行ずつ並べて行ったが、
余りに時間が掛かるため、sedコマンドオプションの-fを使用した。それでもかなり時間掛かったが、-f付きの方が早かった。

2018年9月29日土曜日

【SQL】重複行探すselect文

SELECT *
   FROM (
    SELECT *
                 , ROW_NUMBER OVER (PARTITION BY id) AS row
       FROM tmp_table
  ) as t
WHERE row >= 2;

または、
SELECT id
  FROM tmp_table
GROUP BY id
HAVING count(*) >= 2;

【PostgreSQL】【pg_rman】別サーバーにリストア

pg_rmanだと設定も復旧されてしまう。そのため、別のサーバーにリストアする場合は注意が必要。設定を復旧しない方法は未調査。

2018年9月28日金曜日

【SQL】pg_dumpしたデータでリストア失敗【PostgresSQL】

[事象1]
pg_dumpコマンドで出力したデータを別のサーバーのDBにpsqlコマンドでリストアしたら重複キーエラーが発生した。

補足:実際はレコードのinsertは成功、つまり重複レコードが入ってしまった。その後の主キー制約の作成で重複キーエラーが出力されていた。
postgresのダンプデータの順序は、レコードをcopyした後に主キー制約作成(インデックス作成)という順序になっているらしく、この様な状態となった。

これだけ聞くとPostgreSQLのダンプのバグのように思えるが、実際は違うようだ。

[調査]
元のDB(pg_dumpを実行したDB)を見ると元のDBが壊れていた。
事象としては以下のselect文で結果が違うと言う不可思議な現象だった。

①whereで主キー指定したselect 文
②whereで主キー以外を指定したselect文

これらの結果は一緒になる想定だったのだが、実行すると結果が違って、②の方が数十行多く出力されていた。
このテーブルには、主キーが設定されていたにも関わらず、明らかに重複キーの状態でテーブルに登録されていた。
これによりインデックスと生テーブルに不一致が発生したと判断した。
つまり、インデックスは正しいが、テーブルには重複レコードが存在している。

因みにpostgresはupdateする際は、追記型つまり内部で行をコピー&元の行に削除フラグをたてているはず。この削除フラグの変更が失敗したのではないかと思う。

元のDBが壊れた理由は不明。訳あって調査出来ず。

[復旧]
2回ほど復旧を実施した。もとのDBは運用環境のため、触る事が出来ない。そのため、リストア先DBの復旧を行った。リストア前、リストア後の復旧を行った。とある事情により、それぞれ違う方法を使用した。

(a)ダンプデータを修正して再リストア
中途半端にリストアしたDBは破棄して、ダンプデータをviで修正(重複レコード削除)して再度リストア。
この方法はダンプデータが巨大だとかなり時間がかかる。と言うか、でかすぎるとエディタがまともに動かなくなる。一応、ダンプデータは5GB程度だったかな?なのでこれでも復旧出来た。また、バイナリダンプの場合は使用出来ない。

(b)中途半端にリストアされたDBを復旧
select row_number over partition byで重複レコードを探す。group by having countでも良い。その結果から残したい行のinsert文を作成。
で、重複レコードを二行とも削除(主キー制約作成失敗しているため、A5では片方ずつの削除が出来なかった)。
で作成したinsert文を実行。その後、失敗していた主キー制約を作成して復旧完了。こちらは復旧の仕方が正しいのか不安がある。

2018年9月26日水曜日

【Linux】ファイルコピーで入力/出力エラー【cp】

●エラー
『cp: cannot stat `xxx': 入力/出力エラーです。』
(xxxには具体的な、ファイル名が入る)

ある日、ファイルコピーを実行したら、上記のエラーが発生してコピーに失敗した。
で、/var/log/messagesを見たら、以下のエラーが出力されていた。
『kernel: EXT-fs error (device dm-0) :  ext4_lookup: deleted inode referenced: yyy』
(yyyには数字が入る)

●fsckコマンドで復旧
【注意!!】以下のfsckはファイルが消失する可能性がある。
umount AAA
(AAAにはマウントポイントが入る)

fsck -y /dev/mapper/ZZZ
(ZZZにはボリューム名が入る。)

2018年9月23日日曜日

【Linux】【rm】 */*コマンドのオプションは-vI

rm -vI */*.txt #カレントの全ディレクトリ配下のtxtを削除。
rm -vI */*_????????.txt #カレントの全ディレクトリ配下の日付付きのtxt
rm -i */*.txt #カレントの全ディレクトリ配下のtxtを削除。


rmコマンドでワイルドカード指定する場合は危険なので、確認オプションをつけるようにする。

-iオプションの場合は全ファイルに対して確認が表示される。20ファイル以下なら-iオプションで良い。20以上なら-vIをつけて確認を表示する。

何の意味があるかと言うと、コマンド打ち込みの途中で誤ってEnterを押してしまい、更に* /*など途中にスペースが入ってしまった場合に即実行されないために入れる。-rをつけてないので大丈夫と思うが。

最近のLinuxでは、rm -rf /*は防止されているらしいが、念のためやっておく。
個人的には、オプション指定しなくても確認が出てくれるとありがたいのだが。

-vは削除したファイル名を表示してくれるオプション。誤って関係ないファイルを削除したかどうか確認する。

2018年9月22日土曜日

【Linux】【VirtualBox】【ネットワーク】MACアドレスの重複

過去にあった話2件程紹介します。
どちらも仮想マシンです。物理PCでMACアドレス重複はほぼ有り得ないでしょう。OS側でMACアドレス変更出来たりしますし、ROM焼きすれば物理MAC変えられますが、業務でこれらの事態に遭遇することは無いでしょう 。

■1件目
サーバーのセキュリティー点検とかで、お客さんのセキュリティー部門がデータセンターのサーバーを使用してたのですが、何故かサーバーに繋がらないって言われました。詳細は教えて貰ってないですが、SSH接続か、ブラウザで接続出来なかったのだと思います。

既に環境構築終えて、運用直前だったので報告を聞いて少し焦りましたが、何度も事前に接続していましたし、遠隔でも接続には問題無かったサーバーです。

結局、セキュリティー部門のミスで、仮想マシンのMACアドレスが重複してたせいで、接続出来なかったとのことです。
多分持ち込んだノートPC内の仮想マシン2つが重複したのだと思いきます。

これ以上の情報が届きませでしたので、詳細は不明です。

確かに仮想マシンならMACアドレス重複は可能です。仮想マシンの設定でMACアドレスを指定できます。しかし、どうしてそのような事態になったのでしょうか?

完全にカンで書きますが、セキュリティー部門は案件ごとに仮想マシンを使い分けてたのでは無いでしょうか?社内のルールで案件ごとに分けるよう決まってるという推測です。会社によっては、あるネットワークに接続したOSを別のネットワークに接続するのを、禁止しているとか有り得そうです。

その時私が携わった業務は、お客さんにとっては新規案件でした(お客さん側には沢山の既存案件が有ります)。上記の推測が正しいなら、ノートPC内で新しく仮想マシンをコピーしたと考えられます。VMWarePlayerなら当時はVMコピー後、起動時にコピーしたか、移動したか聞かれたはずです。で移動したと答えると確かMACアドレスを変更しなかったと思います(最近VMWarePlayer使ってませんので、最新版は分かりません) 。

更にコピー元のVMを何故か起動してしまってコピー元とコピー先のVM間でMACアドレス重複してしまったのかな?かなり強引なこじつけですね。

ん?

1人で作業してると思い込んでましたが、2人で作業してたなら、2人のPC間でVMコピーして、MACアドレス重複してた可能性もあるのか・・・。それなら二台同時にVM起動してるのも納得が行きます。サーバー系の作業で、1人作業は有り得ないです。此処まで書いて覆すようですが、そっちの方が可能性高い気がしてきました。

何時もそうですが、お客さん側のミスって、全然情報来ないので何が起こったか真相は不明ですよね。こちらがミスすると、細かいとこまで全部報告して、とてつもなく怒られるのに。

上記の推測が正しいか分かりませんが、VMのコピーは気をつけるようにしましょう。

■2件目
こちらは後輩の話です。

知識や技術は全然無い後輩でした。ある日、上司から後輩の進捗が悪いので、見てこいと言われました。後輩に聞いたらネットワーク接続出来ないとの事でした。

WindowsにVirtualBox入れて、その上にLinuxだったかな?を入れて更にその上に、業務特有の専用VM、専用OSを入れてました。以下のような構成です。

専用OS
専用VM
Linux
VirtualBox
Windows
ホストPC

一番下のWindowsから一番上の専用OSに通信(業務特有の通信)出来ませんでした。一応全てNATにはなってたので(後輩は何故NATが必要かも解って無かったと思います)、通信出来てもおかしくはなかったのですが、駄目でした。

最初に私が確認したのはpingです。

確かLinuxと専用OSの間は問題有りませんでした。(結構前の話なので、曖昧です。すみません。)

次にWindows、専用OS間のpingを試すと片方向のみpingが通りました。Windowsから専用OSはOKで、専用OSからWindowsが駄目でした。

じゃあ間違くWindows側のファイアウォールだろうとWindowsとセキュリティーソフトの設定見直ししましたが問題有りませんでした。

此処で行き詰まりました。

最初から試すべきでしたが、試行錯誤してる中で、WindowsとLinux間もpingを試して、WindowsからLinuxはOKで、LinuxからWindowsが駄目でした。ということで、専用VM側は関係無いと分かりました。

これでNGの範囲が大分限定されました。が、普段WindowsとVirtualBox上のLinux間の通信異常なんて有り得ないので、やはり苦戦しました。

何度か繰り返し設定見直ししていると、Windowsでipconfigを打った時にMACアドレスがふと目に留まりました。どこかで見たと思ったら、LinuxのMACアドレスだったのです。

後輩に聞いたら、要領を得ない何とも曖昧な回答でした。ごまかそうとしてたんだと思います。多分後輩がVirtualBoxの設定でMACアドレスを変更したのでしょう。それを何故かWindowsのものと一緒にしてしまったと。

正直最初から専用VMと専用OSを疑ってました。これらの実績は圧倒的に低かったためです。Windows、VirtualBox、Linuxの間で通信異常なんて有り得ないと思い込んでいました。

解析する時は思い込んでしまったら駄目ですね。全て怪しいと考えて作業しなければなりません。

【C#】IEnumrable+LINQ+Castとforeach【LINQ】

●LINQ
LogicalTreeHelper
    .GetChildren(target)
    .Cast<object>()
    .Where(child => child is DependencyObject)
    .ToList()
    .ForEach(e => RunAllChild((DependencyObject)e, action));

●foreach
foreach (var child in LogicalTreeHelper.GetChildren(target))
    if (child is DependencyObject)
        RunAllChild((DependencyObject)child, action);

う~ん、Cast可能か確認してからCastする場合は、
LINQより、素直にforeachを選択すべきか。

もっといい書き方ありそうだが・・・

【SEの仕事】ウォーターフォールになってない

多くの日本のIT企業はウォーターフォール開発を使っていると思います。(実際はアジャイルやプロトタイプも多いでしようが)。

ウォーターフォールの場合は、前の工程のアウトプット(成果物)が次の工程のインプットになります。建前としては前の工程に戻るという事は無いため、各工程の成果物は、品質の高いものになっている必要があります。
そのため、各工程では念入りに成果物の作成、レビューをします。かなり時間を費やすわけです。で、各工程のレビューはお客さんレビューも実施します。

ここで良く有るパターンが、各工程のレビューを自社レビューのみとしてしまうパターン。これをしてしまうと客先試験で、大ドンデン返しを食らう事があります。客先試験は大抵の場合、一番最後の工程なので途方も無い手戻りが発生する事があります。前に述べたとおり、各工程ではかなりの時間を費やすのです。それを全部ではないにしてもやり直す訳です。

そのため、各工程の成果物は、その都度お客さんにレビューしてもらい、こう言った手戻りが無いようにする必要があります。これが、正しい開発の在り方と思ってます。

ここで問題があって、お客さん側の都合で、仕様書・設計書レビューを試験後にやることが、決められているパターンや、忙しいとの理由でレビューを断られたり、試験後にして欲しいと言われて後回しにされてしまう事があります。そうしておきながら、お客さん試験でいざ使ってみると、こうじゃないと指摘をして、修正しろと言って来ます。

本来、仕事をサボった(ウォーターフォールの定石通りしなかった)のはお客さん側なのですが、それでもお金を貰っている以上やるしかないのです。こうなると前述の通り、かなりの時間をかけているわけですから、工数つまりお金の無駄使いとなってしまうわけです。なので、できることなら各工程でレビューをしてもらうよう努める必要があります。

更に言うと、各工程の最後にレビューをしてもらうだけではなく、週2位で打ち合わせをして、軽く成果物のレビューをしてもらうと大きく方向をズレること無く、方向の微調整が効きます。1チーム4人として、1人1日3ページ(実際はもっと作れるはず。)作れば、週2で打ち合わせするには、十分な量の資料が作成出来ます。

自信が無いなら叩き台レベルと言って作成完了してない旨匂わせます(これはお客さんによって未完成が気に食わないって人もいるでしょうが)。ここで言いたいのは、試験の最後に見てもらうより、各工程の最後、各工程の最後で見て貰うより、週単位で見てもらう。つまり、細かく刻んだほうが大きく道を反れることが無い※と言う事です。勿論、各工程の最後、お客さん試験も実施します。

※レビューア(成果物のレビューをする人)、試験者が違う場合で、2人の意見が違う場合、厄介なことになるのことがあります。

2018年9月21日金曜日

【SEの仕事】好きな業務に付けない話

当然と言えば当然ですが、会社に入ると、好きな業務に就くことは出来ません(場合によっては可能でしょうが)。

私の場合、プログラミングがしたくてSEを志望し、IT企業に入社しましたが、数年間試験業務でした。その後、開発に携わることも有りましたが、インフラ(環境構築)や試験業務が多いです。

会社を辞めるという選択肢もありますが、自分のコミュニケーション能力の低さ、試験業務しか経験が無い点を考えると転職は中々難しいです。

ということで、毎日のつまらない試験業務でモチベーションを保つ工夫をしていました。例えば、Excel VBAやVBS、bat、shスクリプト、PowerShell、TeraTermマクロを使って試験や日々の作業の自動化です。

特にPowerShellはWindowsVista以降は標準で入っており、.NETの標準ライブラリーがある程度使え、簡易デバッガも入っているので導入の手間がありません。

ただ、普段の試験や作業を遅らせて良いわけではないので、先輩・上司に確認のもと、少しずつ作成&改良していきます。

人それぞれ興味は違うので、方法はそれぞれ変わると思いますが、日々の作業がつまらなくても、こういった工夫でモチベーションを保つことが、できます。

【SEの仕事】数十万件のテーブル作ったら…【PostgreSQL】

お客さんの依頼で数十万テーブル(数百万だったかも)作成した時の話です。動的にテーブルを選択するということです。

通常はやらないです。と言うか、普段の開発から逸脱したことはすべきではないです。

上司がその依頼を受け、私は設計後にそのプロジェクトに入ったので止めようが無かったのです。

PostgreSQLの開発者が、数十万テーブルを想定してるのか不明ですが、RDBの使い方としては誤りと言っていいと思います。リレーショナルデータベースと言うものを全く理解してません。リレーショナルデータベースをただのデータとして捉えてはいけません。

結論を言うと、create tableで躓く羽目になりました。テーブルが多くなれば多くなる程、create tableの速度が落ちて行ったのです。確か数十万だか、数百万テーブル作成するのに、1日程度掛かりました。あり得ないです。再構築が容易く出来ないです。また、運用開始後、列追加などが容易く出来るか心配です。

そもそも、create table文を自作する羽目になる(ツールでcreate table文を作成後、テーブル名に_1、_2、を足していく)わけで、これもあり得ないです。通常は、visualstudioやeclipse、そのほかのツールで自動生成し、速攻DBに投入します。(初回起動時に生成する方法もあります。)

これでは、通常通りの開発が出来なくなります。元々、そのプロジェクトは破綻してましたので、どれ程の遅延を招いたか定かでは有りませんが、確実に開発速度を落としていました。

この話に限らず、通常の開発から逸脱したことは避けるべきです。

【SEの仕事】原因不明なエラーの解析【Java】【C#】

お客さんの都合により、複数の会社が同じWebアプリ内の機能を作成する事があります。もちろんそれぞれの会社の作成している機能は別物です。

OutOfMemoryErrorや原因が不明なエラーが発生した場合にどの会社が解析するのかと言う問題があります。

お客さんが事前にどの会社がやるのか決めてくれている場合は良いんですが、そうでない場合が厄介で、本来であれば契約に従う必要があり、契約書に無いことをやってはいけません。が、どの会社も契約してない場合は誰かがやるしかないんです。

しかし、誰もやろうとしないんですよね。
恩を売る、または勉強と割り切って自分で実施しましょう。やって見ないといつまでも機会がありません。こういうバグの解析は稀にしかありません。なぜなら、かなり出来る人間が毎回解析するため。年次が高くなっても出来ないと困ったことになります。プロジェクトを任されて、外のメンバーは1~3年目のみとか詰みます。

■解析方法
JavaやC#のExceptionがログファイルに出ていれば、ソースコードのファイル名と行番号からエラーが特定出来ます。

今回はそうではなく、良く分からないエラーの場合です。
良く分からないエラーって何です?って思いますよね?

例えば、定期処理が動かなくなったとか、画面にもログファイルにも何も出てないが操作が出来ないとか、操作が途中で止まるとか、砂時計のままとか、少し違和感があるとか、異常に遅いとか、・・・。

Exceptionが出てない場合はエラー箇所が分からないため、ソースコードのどこに問題があるのか分からなかったりします。この場合、見るべきことが沢山あります。主なものを以下に記載します。

●Javaの場合
・ログファイル
 エラーが発生したと思われる時間帯の前のログなど。ログファイルは膨大なのでgrep、egrep、head、tail、unique、cut、sort、sed、awk、viewなどのテキスト関連のコマンド、サクラエディタ※1の正規表現置換、ブロック選択、Excelなどを駆使してエラー箇所を絞り込み、エラーの特定、そこまで行かなくても何の処理が動いてたかを把握して解析の取っ掛かりにしたりします。

・Catalina.out
 まずはOutOfMemoryErrorでgrep。Catalina.outも大量にログが出てる場合があります。なのでログファイルと同様の解析をしたりします。皆なんでCatalina.outに余計なログ出すかなあ?Catalina.outはOutOfMemoryとかErrorの子クラスだけにして欲しい。それ以外はロガーに出してくれ。

・リソース使用量
 ・sar
  サーバーのcpu使用量。グラフ化すれば、おかしくなり始めた時間帯などを特定出来ます。

 ・top
  現在の各プロセスのCPU使用量、メモリ使用量。

 ・ps
  スレッド数、ファイルディスクリプタ数などを調べられる。出来れば事前に定期観測しておく。

 ・free(Javaでは余り見ない)
  サーバーのメモリ使用量。

 ・iostat、vmstat記録してたが何に使ったっけ?

 ・コネクション数
  DBコネクション数が限界に達してないか?定期的に記録しておきましょう。何のコマンドだったな?vmstat?netstat?

 ・jconsole
  JavaのCPU使用量、ヒープ使用量、メモリ使用量。

 ・jstat
 ヒープ使用量定期観測。事前に仕掛けておく。

 ・ヒープ内の各クラスのメモリ使用量。コマンド名は何だったかな?
  メモリリークの場合、どのクラスがリークしてるか分かるので必須です。特に正常時と異常時の比較、起動直後と時間経過後の比較をすると、あっさり原因特定出来たりします。

・jstack
 ・スレッドの状態(最近はスレッド数が多くて一苦労)
 ・スタックの状態
 ・ロック残り、デッドロックの有無

●Windowsの場合
・タスクマネージャー
 windows用。列追加すると色々見られる。プロセスのCPU使用量、メモリ使用量、ファイルディスクリプタ、スレッド数、GDIオブジェクトなどのリーク。

・リソースマネージャー
 タスクマネージャーより詳しく見られるらしい。余り使ったこと無い。

・typeperf
 プロセスのCPU、メモリ使用量、ファイルディスクリプタ、スレッド数などを定期観測。事前にしかけておく。何れも増え続けているものは注意。typeperfはGDIオブジェクトが記録出来ない。何でだ?

●DBがある場合(製品によって確認方法が違うのでざっくり記載。)
・トランザクション残り
 デッドロックやトランザクション残りの特定。
 実行中のselect文が見られる場合があり、問題のある機能が特定出来る。また、手動でinsert文実行時にトランザクション途中でウィンドウを閉じて、トランザクションが残ってしまい、他の機能が動かない問題などの特定。トランザクション残りって呼んでますが、本当は何て呼ぶんでしょう?

・ロック残り
 トランザクション残りとほぼ同じ。デッドロックの特定。

怪しい箇所は時系列順にメモして、最初のエラーを特定します。リーク系は最初ではなく、時系列でみます。
また、正常時との比較も重点です。

※1 他のエディタでもいいですが、巨大なログファイルを扱える必要があります。サクラエディタは結構耐えてくれます。分割してもいいですが。