| 開発者 | Apache ソフトウェア財団 |
|---|---|
| 初回リリース | 2015年10月8日 |
| 安定リリース | 4.3.0
/ 2024年9月7日 |
| リポジトリ |
|
| 書かれた | C++、Python |
| オペレーティング·システム | Linux、macOS、Windows |
| ライセンス | Apache ライセンス 2.0 |
| Webサイト | シンガ |
Apache SINGAは、オープンソースの機械学習ライブラリを開発するためのApache のトップレベル プロジェクトです。スケーラブルな分散トレーニングのための柔軟なアーキテクチャを提供し、さまざまなハードウェアで実行できるように拡張可能で、医療アプリケーションに重点を置いています。
Apache SINGAは、大規模データ分析のための分散型、効率的、スケーラブルで使いやすいディープラーニングプラットフォームの開発により、2024 SIGMOD Systems Award [1]を受賞しました。
歴史
SINGAプロジェクトは、大規模な複雑な分析をサポートし、データベースシステムをよりインテリジェントで自律的なものにするために、シンガポール国立大学のDBシステムグループが浙江大学のデータベースグループと共同で2014年に開始しました。[2]モデルとデータをクラスター内のノードに分割し、トレーニングを並列化することで、分散型ディープラーニングに焦点を当てました。[3] [4]プロトタイプは2015年3月にApache Incubatorに受け入れられ、2019年10月にトップレベルプロジェクトとして卒業しました。以下の表は、最新バージョン、最新のプレビューバージョン、まだメンテナンスされている古いバージョン、古いバージョンなど、さまざまな種類のバージョンに関する情報を示しています。
ソフトウェアスタック
SINGA のソフトウェア スタックには、コア、IO、モデルという 3 つの主要コンポーネントが含まれています。次の図は、これらのコンポーネントをハードウェアとともに示しています。コア コンポーネントは、メモリ管理とテンソル操作を提供します。IO には、ディスクとネットワークから (およびディスクとネットワークに) データの読み取り (および書き込み) を行うクラスがあります。モデル コンポーネントは、機械学習モデルのデータ構造とアルゴリズム(ニューラル ネットワークモデルのレイヤー、一般的な機械学習モデルのオプティマイザー/イニシャライザー/メトリック/損失など) を提供します。

シンガオート
SINGA-Auto(VLDB2018ではRafiki [5]としても知られる)は、機械学習モデルのトレーニングおよび推論サービスを提供するApache SINGAのサブシステムです。SINGA-Autoは、機械学習モデルの構築、ハイパーパラメータの調整、予測精度と速度の最適化からユーザーを解放します。ユーザーはデータセットをアップロードし、トレーニングを行うようにサービスを設定し、推論用にモデルをデプロイするだけです。クラウドサービスシステムとして、SINGA-Autoはハードウェアリソース、障害回復などを管理します。使いやすさを考慮して、構造化データ(EMRデータなど)分析、画像認識、テキスト処理などの一般的なタスク用の組み込み機械学習モデルのセットであるモデルズーを提供しています。
トレーニング サービスでは、分散ハイパーパラメータ チューニングの一般的なフレームワークが提案され、ディープラーニング モデル専用の協調チューニング スキームが設計されています。推論サービスでは、強化学習に基づくスケジューリング アルゴリズムが提案され、全体的な精度を最適化し、レイテンシを削減します。リクエスト レートの変化に適応できます。
SINGA-イージー
SINGA-Easy [6] (ACM Multimedia 2021) は、Apache SINGA のコンポーネントとして構築された使いやすいディープラーニングフレームワークであり、ドメイン固有のドメインアプリケーションユーザー (マルチメディア、医療画像分析など) によるディープラーニングアルゴリズムと推論サービスの採用を容易にします。トレーニング段階での分散ハイパーパラメータ調整、推論段階での動的な計算コスト制御、モデルの説明によって促進されるマルチメディアコンテンツとの直感的なユーザーインタラクションを提供します。精度を向上させるために、画像と構造化データの正則化のための正則化手法をサポートしています (ACM SIGMOD 2023)。ドメインユーザーがトレーニング結果を受け入れられるように、SINGA-Easy は、LIME [7]と Grad-CAM [8]に基づいてモデルの説明の観点からモデルのパフォーマンスを評価するオプションをユーザーに提供します。
MLCask
MLCask [9] (IEEE ICDE 2021) は、データクリーニングからデータ分析まで機械学習パイプラインを管理するパイプライン管理サブシステムであり、共同分析のための機械学習パイプラインの進化とバージョン管理のメンテナンスを容易にします。コストを削減し、導入を促進します。MLCask は、Git のようなエンドツーエンドの ML ライフサイクル管理をサポートしています。パイプライン コンポーネントとワークスペースのバージョン履歴を活用することで、MLCask は変更されていない前処理手順をスキップし、頻繁な再トレーニングの課題に対処できます。非線形バージョン管理セマンティクスとマージ操作により、パイプラインの効果的な共同開発が容易になります。
データベース内モデル選択
バージョン 4.1.0 以降、Apache SINGA は PostgreSQL のデータベース内モデル選択と推論をサポートします。このシステムは、トレーニング不要のモデル選択手法とトレーニングベースのモデル選択手法の両方を組み込んだ、リソース効率の高い 2 段階のモデル選択アルゴリズムを実装しています。このモデル選択アルゴリズムは、実行待ち時間とメモリ消費を最適化するストアド プロシージャを介して PostgreSQL に非侵入的に統合されます。データベース内モデル選択を組み込むことで、ユーザーは指定された応答時間要件内で高性能なモデルを取得できます。
アプリケーション
Apache SINGA [10]は、 NetEase [11]、Carnegie Technologies、CBRE、Citigroup、JurongHealth Hospital、National University of Singapore、National University Hospital、Noblis、Shentilium Technologies、Singapore General Hospital、Tan Tock Seng Hospital 、YZBigDataなどの組織で使用されています。Apache SINGAは、銀行、教育、金融、医療、不動産、ソフトウェア開発などのカテゴリのアプリケーションで使用されています。
Apache SINGAと社会貢献
Ng Teng Fong総合病院[12]はApache SINGAチームと協力して、血糖値が正常値より高いが糖尿病と分類されるほど高くない状態である糖尿病前症と診断された人々のためのアプリケーションを開発した。
JurongHealth Food Log (JHFoodLg) アプリと呼ばれるアプリケーションは、Apache SINGA を使用して、ナシパダン、ラクサ、チャーシューライスなどの地元料理のデータベースと食べ物の写真を照合し、健康推進委員会、JurongHealth Campus、オーストラリア食品栄養データベースの栄養データを活用します。包括的なデータクリーニング (一貫したフォーマット、重複排除、食品の分類、人間によるキャリブレーションなど) の後、データベースには 209,861 枚の画像が含まれ、13 の食品グループと 233 の食品カテゴリをカバーしています。
このアプリにより、病院のライフスタイル介入(Liven)プログラムのユーザーは減量と運動の目標を設定できる。6か月間の調査では、このアプリを使用した20人の患者のほぼ全員が、当初の体重の4~5%を減らしたことが明らかになった。
参照
参考文献
- ^ 「SIGMOD システム賞」。
- ^ Wei, Wang; Meihui, Zhang; Gang, Chen; HV, Jagadish; Beng Chin, Ooi; Kian-Lee, Tan (2016 年 6 月). 「データベースとディープラーニングの出会い: 課題と機会」. SIGMOD Record . 45 (2): 17–22. arXiv : 1906.08986 . doi :10.1145/3003665.3003669. S2CID 6526411.
- ^ オイ、ベン・チン;タン、キアン・リー。王盛;王、魏。蔡、青潮。チェン、ガン。ガオ、晋陽。羅、肇京。タン、アンソニー KH;王、袁。謝中楽。張美輝。鄭、開平(2015)。 「SINGA: 分散型深層学習プラットフォーム」(PDF)。マルチメディアに関する第 23 回 ACM 国際会議の議事録。 685–688ページ。土井: 10.1145/2733373.2807410。S2CID 1840240 。2016 年9 月 8 日に取得。
- ^ Wei, Wang; Chen, Gang; Anh Dinh, Tien Tuan; Gao, Jinyang; Ooi, Beng Chin; Tan, Kian-Lee; Sheng, Wang (2015). 「SINGA: マルチメディア ユーザーの手にディープラーニングを」(PDF)。第 23回 ACM 国際マルチメディア会議の議事録。pp. 25–34。doi :10.1145/2733373.2806232。S2CID 7169465。2016年9月8 日閲覧。
- ^ Wang, Wei; Gao, Jinyang; Zhang, Meihui; Sheng, Wang; Chen, Gang; Khim Ng, Teck; Ooi, Beng Chin; Shao, Jie; Reyad, Moaz (2018). 「Rafiki: 分析サービスシステムとしての機械学習」(PDF) . Proceedings of the VLDB Endowment . 12 (2): 128–140. arXiv : 1804.06087 . Bibcode :2018arXiv180406087W. doi :10.14778/3282495.3282499. S2CID 4898729 . 2019年1月9日閲覧。
- ^ Xing, Naili; Yeung, Sai Ho; Cai, Chenghao; Ng, Teck Khim; Wang, Wei; Yang, Kaiyuan; Yang, Nan; Zhang, Meihui; Chen, Gang; Ooi, Beng Chin (2021). 「SINGA-Easy: マルチモーダル分析のための使いやすいフレームワーク」(PDF)。第29回ACM国際マルチメディア会議の議事録。pp. 1293–1302。doi :10.1145/ 3474085.3475176。ISBN 978-1-4503-8651-7. 2021年10月17日閲覧。
- ^ Ribeiro, Marco Tulio; Singh, Sameer; Guestrin, Carlos (2017). 「なぜあなたを信頼すべきか?」:あらゆる分類器の予測の説明(PDF)。知識発見とデータマイニングに関する第22回ACM SIGKDD国際会議の議事録。pp. 97–101。arXiv : 1602.04938。doi : 10.1145 / 2939672.2939778 。 2016年8月1日閲覧。
- ^ Selvaraju, Ramprasaath R.; Cogswell, Michael; Das, Abhishek; Vedantam, Ramakrishna; Parikh, Devi; Batra, Dhruv (2017). 「Grad-CAM: 勾配ベースのローカリゼーションによるディープネットワークからの視覚的説明」(PDF) . 2017 IEEE 国際コンピュータビジョン会議 (ICCV) . pp. 618–626. arXiv : 1610.02391 . doi :10.1109/ICCV.2017.74. ISBN 978-1-5386-1032-9。
- ^ Luo, Zhaojing; Yeung, Sai Ho; Zhang, Meihui; Zheng, Kaiping; Zhu, Lei; Chen, Gang; Fan, Feiyi; Lin, Qian; Ngiam, Kee Yuan; Ooi, Beng Chin (2021). 「MLCask: 共同データ分析パイプラインにおけるコンポーネント進化の効率的な管理」。2021 IEEE 37th International Conference on Data Engineering (ICDE)。pp. 1655–1666。arXiv : 2010.10246。doi :10.1109/ ICDE51399.2021.00146。ISBN 978-1-7281-9184-3. S2CID 224802796。
- ^ 「Apache Software Foundation、Apache Singaをトップレベルプロジェクトとして発表」。news.apache.org 。 2019年11月4日。 2019年11月4日閲覧。
- ^ 网易 (2017 年 6 月 2 日)。 「网易携帯手Apache SINGA角逐次人工智能新战场_网易科技」。tech.163.com 。2017 年 6 月 3 日に取得。
- ^ 「糖尿病予備群が食事の写真を使って健康的かどうかをチェックできる新アプリ」ザ・ストレーツ・タイムズ。2019年1月24日。 2019年4月6日閲覧。
外部リンク
- 公式サイト
