HIKESHIは肺や多細胞生物の発生において重要なタンパク質であり[ 5 ]、ヒトではHIKESHI遺伝子によってコードされている[ 6 ]。HIKESHIはヒトでは11番染色体、マウスでは7番染色体に存在する。類似の配列(オルソログ)はほとんどの後生動物に見られる。マウスの相同遺伝子である7番染色体上の致死遺伝子Rinchik 6タンパク質はl7Rn6遺伝子によってコードされている(ヒトとマウスの遺伝子名の調和後、Hikeshiと改名された)。 [ 7 ]
HIKESHIはヒトのタンパク質コード遺伝子です。この遺伝子の別名はFLJ43020、HSPC138、HSPC179、L7RN6です。染色体11の長腕q14.2領域に位置し、イントロンとエクソンを含む遺伝子全体はプラス鎖で42,698塩基対です。HIKESHIバリアント1のmRNAはエクソン1、3、4、5、7を含み、合計1,183塩基対で、239~832番目の塩基対がコード領域です。
バリアント1は、最も長く、最も一般的なタンパク質コードバリアントです。他の3つの主要なバリアントは、読み枠を狂わせる代替エクソン配列を使用し、mRNA配列の早期終結を引き起こし、タンパク質分解につながります。下の表は、さまざまなバリアントとエクソンの使用状況を示しています。
上の表に示されている4つのバリアントは、ヒト細胞で最も一般的なアイソフォームです。合計13の選択的スプライシング配列と、2つの代替プロモーターを利用する3つの非スプライシング型が存在します。mRNAバリアントは、8つの異なるエクソンの組み合わせ、代替の重複エクソン、およびイントロンの保持によって異なります。選択的スプライシングに加えて、mRNAは3'末端の切断によっても異なります。バリアント1は、タンパク質をコードすることが示されている10個のmRNAのうちの1つであり、残りはナンセンス変異依存性mRNA分解に向かうようです。

プロモーター領域GXP 47146は、GenomatixのElDorado [ 9 ]ツールを使用して発見されました。840 bpの配列は、DNAポイント86012753から86013592のHIKESHI遺伝子の前に位置します。このプロモーターは12個のオルソログすべてで保存されており、6つの関連転写産物をコードしています。
Genomatix ElDoradoツールによる保存された転写因子結合部位:

mRNA産物の終結は、遺伝子のcDNA内にコードされている。mRNA産物の終結には、一般的に3つの主要な特徴がある。ポリAシグナル、ポリAテール、およびステムループ構造を形成できる配列領域である。ポリAシグナルは、高度に保存された6ヌクレオチド長の配列である。真核生物では、この配列はAATAAAであり、ポリA部位から約10~30ヌクレオチドの位置にある。AATAAA配列は、高度に保存された真核生物のポリAシグナルであり、シグナル配列の10~30塩基対後にmRNA産物のポリアデニル化を指示する。C11orf73のポリA部位はGTAである。
2006年時点でNCBIデータベースに登録されている唯一のSNP(一塩基多型)は、 C11orf73配列においてタンパク質内のアミノ酸置換を引き起こすものである[ 10 ]。他のSNPが存在しないのは、HIKESHIの保存性の高さと、タンパク質の変異が生物に及ぼす致死的な影響によるものと考えられる。このSNPの表現型は不明である。
その後、 HIKESHI遺伝子にはさらに多くの多型があることが知られるようになった。これらの変異の1つであるc.160G>C;p. (Val54Leu)は、 HIKESHI関連白質ジストロフィー(HAL)と呼ばれる遺伝性劣性低髄鞘形成性白質ジストロフィーを引き起こす。罹患者は幼少期に筋緊張低下を示し、徐々にジストニアへと進行する。この疾患アレルはアシュケナージ系ユダヤ人の間で一般的であり、保因者頻度は126人に1人である。[ 11 ]この変異はおそらく機能喪失変異であり、タンパク質の安定性を失わせ、ミスフォールディングを引き起こす。[ 12 ]
HIKESHIの周囲の遺伝子はCCDC81、ME3、およびEEDである。遺伝子の近傍を調べることで、周囲の遺伝子の機能を調べ、HIKESHIの可能性のある機能についてより深く理解することができる。
CCDC81遺伝子は、未解明のタンパク質産物をコードしており、プラス鎖上に配置されている。CCDC81は、コイルドコイルドメイン含有81アイソフォーム1の略である。
ME3遺伝子はミトコンドリアリンゴ酸酵素3前駆体を表します。リンゴ酸酵素は、補因子としてNAD+またはNADP+を使用して、リンゴ酸のピルビン酸への酸化的脱炭酸を触媒します。哺乳類の組織には、細胞質NADP(+)依存性アイソフォーム、ミトコンドリアNADP(+)依存性アイソフォーム、およびミトコンドリアNAD(+)依存性アイソフォームの3つの異なるリンゴ酸酵素アイソフォームが含まれています。この遺伝子はミトコンドリアNADP(+)依存性アイソフォームをコードしています。この遺伝子には複数の選択的スプライシング転写バリアントが見つかっていますが、一部のバリアントの生物学的妥当性は決定されていません。[ 14 ]
EED遺伝子は、胚性外胚葉発生アイソフォームbの略で、ポリコーム群(PcG)ファミリーの一員です。PcGファミリーのメンバーは多量体タンパク質複合体を形成し、連続する細胞世代にわたって遺伝子の転写抑制状態を維持することに関与しています。このタンパク質は、エンハンサー・オブ・ゼスト2、インテグリンβ7の細胞質尾部、免疫不全ウイルス1型(HIV -1)MAタンパク質、およびヒストン脱アセチル化酵素タンパク質と相互作用します。このタンパク質は、ヒストン脱アセチル化を介して遺伝子活性の抑制を媒介し、インテグリン機能の特異的調節因子として機能する可能性があります。この遺伝子には、異なるアイソフォームをコードする2つの転写バリアントが同定されています。[ 15 ]
HIKESHIは、平均の2.3倍という高いレベルで普遍的に発現していることが判明した。C11orf73は多数のヒト組織で発現している。[ 16 ] [ 17 ] UniGeneの発現プロファイルとESTプロファイルの間では、C11orf73を発現していない組織はわずか11個しか示されておらず、これはおそらく組織のサンプルサイズが小さいためである。
ヒトのHIKESHI遺伝子は、未解明タンパク質C11orf73と呼ばれるタンパク質をコードしている。[ 6 ]相同なマウスL7rn6遺伝子は、染色体7上の致死遺伝子Rinchik 6 と呼ばれるタンパク質をコードしている。[ 7 ]
1 mfgclvagrl vqtaaqqvae dkfvfdlpdy esinhvvvfm lgtipfpegm ggsvyfsypd 61 sngmpvwqll gfvtngkpsa ifkisglksg egsqhpfgam nivrtpsvaq igisvellds 121 maqqtpvgna avssvdsftq ftqkmldnfy nfassfavsq aqmtpspsem fipanvvlkw 181 yenfqrrlaq nplfwkt
コード化されたヒトタンパク質は197個のアミノ酸からなり、分子量は21,628ダルトンである。マウスタンパク質との類似性から、ヒトHIKESHIタンパク質の仮説上の機能は、肺細胞における分泌装置の組織化と機能であると考えられる。[ 5 ]
DUF775(機能不明ドメイン775)と呼ばれるタンパク質ドメインは、ヒトのHIKESHIタンパク質とマウスのL7rn6タンパク質の両方に存在します。DUF775ドメインは197アミノ酸からなり、タンパク質全体の長さと同じです。定義上、DUF775スーパーファミリーを構成する他のタンパク質には、C11orf73のすべてのオルソログが含まれます。
疎水性分析の結果、このタンパク質には広範囲にわたる疎水性領域が存在しないことが示され、したがって、HIKESHIは細胞質タンパク質であると結論付けられる。C11orf73の等電点は5.108であり、より酸性の環境で最適に機能することを示唆している。
STRING [ 19 ]および Sigma-Aldrich の Favorite Gene [ 20 ]というプログラムは、C11orf73 とのタンパク質相互作用の可能性を示唆した。ARGUL1、CRHBP、および EED はテキストマイニングから得られ、HNF4A は Sigma-Aldrich から入手した。
ARGUL1は機能が不明な未知のタンパク質である。CRHBPは副腎皮質刺激ホルモン放出ホルモン結合タンパク質であり、HIKESHIに関与または活性化するシグナルカスケードにおいて役割を果たす可能性がある。C11orf73の近傍タンパク質であるEEDは、胚性外胚葉発生タンパク質であり、ポリコーム群(PcG)ファミリーのメンバーである。PcGファミリーメンバーは多量体タンパク質複合体を形成し、連続する細胞世代にわたって遺伝子の転写抑制状態を維持することに関与している。HNF4Aは転写調節因子であり、HNF4AがC11orf73の発現を調節するのか、あるいは単に相互作用するだけなのかは不明である。[12

生物の進化の歴史は、オルソログの配列を時間参照として使用して系統樹を作成することで決定できます。CLUSTALW [ 21 ]は複数の配列を比較し、このプログラムは C11orf73 のオルソログに基づいてこのような系統樹を作成するためにも使用できます。右側のツリーは、分岐時間に基づくタイムラインとともに生成された系統樹を示しています。HIKESHI オルソログから作成されたツリーは、魚類、鳥類、菌類などの類似した生物をグループ化するなど、文献の系統樹と同一です。
相同配列は、種分化によって分離された場合にオルソログと呼ばれます。つまり、ある種が2つの異なる種に分岐すると、結果として生じた種における単一遺伝子の異なるコピーはオルソログであると言われます。オルソログ、またはオルソログ遺伝子とは、共通の祖先から生じたため互いに類似している、異なる種の遺伝子のことです。オルソログ配列は、生物の分類学的分類や系統学的研究において有用な情報を提供します。遺伝的分岐のパターンは、生物の近縁関係を追跡するために使用できます。非常に近縁な2つの生物は、2つのオルソログ間で非常に類似したDNA配列を示す可能性が高いです。逆に、他の生物から進化的に遠縁な生物は、研究対象のオルソログの配列においてより大きな分岐を示す可能性が高いです。
染色体11のオープンリーディングフレーム73のオルソログの表
この表には、13個の配列(12個のオルソログ、1個のオリジナル配列)と、タンパク質名、アクセッション番号、ヌクレオチド配列、タンパク質配列、およびE値が記載されています。アクセッション番号は、NCBIタンパク質データベースの識別番号です。ヌクレオチド配列は、DBSOURCEのタンパク質配列ページからアクセスできます。DBSOURCEにはアクセッション番号とヌクレオチド配列ページへのリンクがあります。各オルソログとその生物種ごとのヌクレオチド配列とタンパク質配列の長さも表に記載されています。配列の長さの横には、オリジナルのHIKESHI遺伝子に対するオルソログの配列が記載されています。配列の配列とE値は、SDSC Biology WorkbenchのグローバルアライメントプログラムALIGNとNCBIのBLASTを使用して取得しました。
このグラフは、生物の分岐時間に対するオルソログの相同性の割合を示しており、ほぼ直線的な曲線を描いています。曲線内の2つの主要な分岐点は、それぞれ約4億5000万年前と11億5000万年前の遺伝子重複の時期を示唆しています。遺伝子重複によって生じたパラログは、HIKESHIの高度に保存されたオルソログとは非常に異なっているため、BlinkやBLASTツールでは検出されませんでした。


m(100アミノ酸セグメントで発生したアミノ酸変化の総数)は、n(テンプレート配列からのアミノ酸の違いの数)の補正値であり、λ(1年あたりの平均アミノ酸変化数、通常はλE9の値で表される)を計算するためにも使用されます。
m/100 = –ln(1-n/100) λ = (m/100)/(2*T)

