English
SUMMIT_JP_2026 / BUILDER'S FAIR · HALL7 BF-01 ── SYSTEM DOSSIER

しまってAI

面倒なことは Physical AI にやらせよう! 〜家のお片付けロボット〜 / システム全体像ドキュメント

出展 / Hall7 BF-01 構成 / Edge-to-Cloud Physical AI 基準 / 2026 年 6 月時点
SCROLL TO READ

AI が、現実世界に出てきたはじめに ── このデモが指し示すもの

「Physical AI の時代が来た」とよく言われる。Amazon にとって、それは未来の予言ではなく、毎日の現実だ。

私たちは世界中の倉庫で 100 万台を超えるロボットを動かし、フリート全体を協調させる基盤モデル(DeepFleet)まで自分たちの現場規模で運用してきた。「現実世界を AI で動かす」難しさに、毎日ぶつかって、毎日解いてきた会社だ。その実装と運用で培ったものが、AWS という形で開かれている

数ヶ月かかる学習を GPU シミュレーションで数時間に圧縮し、鍛えた頭脳を実機へ移し(Sim2Real)、エッジで低遅延に動かし、多数台を束ねて運用する——Physical AI の長い道のりを、最初から最後まで一つの土台の上で組める。それが AWS を選ぶ意味だ。

この資料について

この「しまってAI」は、その一気通貫をスライドではなく、目の前で動く一台でお見せするデモだ。本ドキュメントはその設計の全体像をまとめている。あなたが次に動かす一台も、ここから始められる。ぜひ、声をかけてみてください。ざわ…ざわ…

§00

エグゼクティブサマリーこれは何のデモか ── 30秒で掴む

ABOUT

正式タイトル:面倒なことは Physical AI にやらせよう! 〜家のお片付けロボット〜 / コードネーム:しまってAI

出展:AWS Summit Japan 2026 / Builder's Fair / Hall7 BF-01

来場者がマイクに話しかけると、キャラクター「お片付け幽霊」が応答し、ミニチュアハウス内の SO-101 ロボットアームが消しゴムやマーカーを自動で片付ける Edge-to-Cloud の Physical AI デモ

  • クラウドの知能(会話エージェント・VLM による成否判定)と エッジのリアルタイム制御(Jetson Thor 上で VLA 推論)を AWS IoT Core(MQTT) で疎結合に連携する構成。
  • ロボットの動作モデルは VLA(Vision-Language-Action)モデルを模倣学習でFT し、テレオペでのデータ収集 → SageMaker で学習 → Systems Manager + S3 でエッジへ配信、という ロボット版 MLOps パイプラインを一気通貫で構築。
  • 教育用ロボット SO-101(実売 4 万円級)+推論用エッジ計算機 NVIDIA Jetson AGX Thor 開発キット(約 3,499 ドル / 約 50 万円台)で構成。アーム自体は安価で、AWS のマネージドサービス群だけで企業級デモが組めることを示すのが狙い。
§01

コンセプトとシナリオ散らかった家を、声だけで片付ける

「散らかった家を片付けるのは大変。ロボットが勝手に片付けてくれたら」という日常課題を、Physical AI と IoT 対応ロボットで解決して見せる体験型デモ。

  • ミニチュアハウス(アルミフレーム筐体)の中に SO-101 アームを設置し、来場者の音声指示だけでロボットが物をしまう。
  • ロボットは事前にプログラムされた固定動作ではなく、カメラ映像と言語指示から行動を生成する VLA モデルで動く(=「学習させたから動く」ことを訴求)。
  • 行動後はロボット自身が俯瞰カメラの映像を VLM で評価し、成功/失敗を判断して喋る(自律的なクローズドループ)。
§02

システム全体アーキテクチャクラウド/エッジ/学習/物理ブースの4レイヤー

クラウド(リアルタイム制御系)/エッジ(Jetson Thor)/学習パイプライン(オフライン)/物理ブースの4レイヤーで構成される。

architecture_overview.mmd(計画を含む統合ビュー)
flowchart TB subgraph BOOTH["展示ブース(Hall7 BF-01)"] VISITOR["来場者"] MIC["マイク"] APP["アプリ画面
筐体裏の備付ディスプレイ"] THORDISP["Thor画面
持込PCモニタ・カメラ映像常時表示"] SLIDE["展示説明画面
筐体横ディスプレイ・HTMLループ+QR"] subgraph CAGE["ミニチュアハウス筐体(アルミフレーム 97x65x65cm)"] FA["SO-101 フォロワーアーム x2"] LA["SO-101 リーダーアーム x1
手動操作・テレオペ用"] CAMTOP["俯瞰カメラ x1
OBR-WEBCAM200"] CAMWRIST["手先カメラ x2
InnoMaker U20CAM-1080P"] LED["LED照明 x4
外乱光対策"] ITEMS["物品
消しゴム・マーカー・サイコロ等"] end end subgraph EDGE["エッジ(NVIDIA Jetson AGX Thor)"] SR["Strands Robots
VLA推論ランタイム"] VLAM["VLAモデル
π0.5 / ACT / GR00T
(学習・検証/本番ライブは ACT)"] GGC["AWS Systems Manager
ハイブリッド管理 + S3 取得"] SR --> VLAM end subgraph CLOUD["AWS クラウド"] WEBHOST["CloudFront + S3
アプリ/ダッシュボード/資料配信"] VOICEAGENT["ボイスエージェント
Strands Agents + Bedrock"] POLLY["Qwen3-TTS(SageMaker 推論EP)
お片付け幽霊の声(ボイスクローン)"] VLM["Bedrock VLM
俯瞰画像でタスク成否判定"] IOT["AWS IoT Core
MQTT ブローカー"] end VISITOR -->|"音声指示"| MIC MIC -->|"発話"| APP APP <-->|"HTTPS"| WEBHOST APP -->|"指示テキスト"| VOICEAGENT VOICEAGENT -->|"応答テキスト"| POLLY POLLY -->|"音声"| APP VOICEAGENT -->|"アクションコマンド publish"| IOT IOT <-->|"MQTT sub/pub"| SR SR -->|"USB制御"| FA SR -->|"USB制御"| LA CAMWRIST -->|"USB映像"| SR CAMTOP -->|"USB映像"| SR FA --> ITEMS CAMTOP -.->|"俯瞰画像(計画)"| VLM VLM -.->|"成否判定(計画)"| VOICEAGENT LED -.->|"USB給電・常時点灯で照射"| ITEMS VOICEAGENT -.->|"照明のクラウド制御は構想のみ(未実装)"| LED THORDISP -.->|"映像表示"| SR
図の読み方(重要)

本図は計画仕様を含む統合ビュー。点線(破線)の経路 ── 照明のクラウド制御俯瞰画像の VLM 成否判定 ── は現リポジトリのコードには未実装。実装済みの構成(コード検証済み)は本セクション下部の「実装版 E2E アーキテクチャ」図を参照。

ポイント設計上の要点

  • クラウド側は 完全サーバレス/マネージド(Strands Agents・Bedrock・Polly・IoT Core・CloudFront・S3)。
  • クラウドとエッジは IoT Core の MQTT で疎結合。クラウドのエージェントが自然言語コマンドを publish し、エッジの Strands Robots が常時 subscribe して VLA 推論を起動する。
  • VLA 推論はエッジ(Jetson Thor)でローカル実行するため、ネットワーク遅延の影響を受けずリアルタイムにアームを制御できる。
  • 計画 行動の成否判定をクラウドの VLM(Bedrock)が俯瞰カメラ画像で行う構想。知能はクラウド、即応はエッジという役割分担。※現コードには未実装。
  • 構想のみ 照明のクラウド ON/OFF 制御は当初の要望だが、現コードは未実装。LED は USB 給電で常時点灯しているだけ。

2.1実装版 E2E アーキテクチャ(コード検証済み)

上図は計画を含む統合ビュー。下図は 実際にコードへ実装されている構成をリポジトリ精読で確定した実装版 E2E アーキテクチャ。推論・会話・IoT 制御はすべて ap-northeast-1 単一リージョンで完結する(学習系のみ別リージョン、§06 参照)。会話エージェントは Bedrock AgentCore Runtime(ECR コンテナ上で動く Strands Agents + FastAPI WebSocket)として稼働し、Transcribe・Bedrock Claude・SageMaker TTS を呼び出して IoT Core 経由でエッジへコマンドを publish する。

assets/aws-architecture.png(コード検証済み・実装版 E2E)
しまってAI 推論系 AWS アーキテクチャ実装版(ap-northeast-1 単一リージョン)。Browser が Cognito JWT で認証し API Gateway→Lambda が presigned WebSocket URL を返却、ブラウザは Bedrock AgentCore Runtime(ECR コンテナ上の Strands Agents + FastAPI)へ wss 接続。Runtime は Transcribe(STT)・Bedrock Claude Haiku(LLM)・SageMaker Qwen3-TTS(TTS) を呼び出し、IoT Core(MQTT) へコマンドを publish。IoT Core(MQTT)で Jetson AGX Thor へ直接連携→Strands Robots→VLA(ACT ほか)→SO-101 アーム。モデル配信は Systems Manager + S3(Greengrass は将来オプション)。VLM 成否判定は計画(破線)。CloudFront+S3 がアプリを配信。
§03

技術スタック / 利用 AWS サービスクラウドは完全マネージド、エッジは Jetson

// tech stack
レイヤー要素役割・備考
クラウド:会話Strands Agentsクラウド上のボイスエージェント本体。指示の解釈・会話・アクション発行を統括
Amazon Bedrockエージェントの LLM。会話応答とアクション判断
Amazon Bedrock(VLM)行動後の俯瞰カメラ画像を見てタスク成否を判定(クローズドループ)計画
Qwen3-TTS(SageMaker 推論EP)音声合成(TTS)。「お片付け幽霊」のキャラボイスをボイスクローンで生成。ストリーミング推論。Amazon Polly(Kazuha)はエンドポイント未設定時のフォールバック
音声認識(STT)マイク入力をテキスト化。= Amazon Transcribe Streaming
クラウド:通信AWS IoT CoreMQTT ブローカー。クラウド↔エッジの司令(shimatte/command)・状態(shimatte/status
クラウド:配信CloudFront + S3アプリ画面・学習ダッシュボード・展示説明資料(HTML/PDF)の静的配信
クラウド:学習SageMaker AI(Training)VLA モデル(π0.5 / ACT / GR00T 等)の模倣学習 FT ジョブ
SageMaker MLflow Apps学習を Experiment として記録。実機推論時の Artifact も保存しトレース可能
GPU 学習インスタンスg6.2xlarge / g6e.2xlarge。20 エピソードで 6 時間程度の学習を想定
AWS Systems ManagerThor 内へリモートアクセスし S3 へデータアップロード等を実施
クラウド:シミュレーションNVIDIA Isaac SimSim 版データ収集環境。Sim2Real を見据える
エッジNVIDIA Jetson AGX Thorエッジ推論機。VLA をローカル実行(Orin から Thor に変更)
Strands RobotsStrands Agents のツールとして VLA/ロボット制御を扱うフレームワーク(lerobot をラップ)
AWS Systems Managerハイブリッド有効化で Jetson をクラウド管理。send-command でエッジへモデル配信(エッジが S3 から presigned URL で取得)
AWS IoT Greengrassモデル自動配信の将来オプション(nucleus は同居・配信には未使用)
VLA モデル3つの VLA を並行学習・実機検証。本番ブースのライブデモは ACT が3タスク(消しゴム・マーカー・サイコロ)を実行。① π0.5lerobot/pi05_base, PaliGemma 2B + Gemma 300M ベース)=大型・汎化に強い本命格(検証で3タスク)、② ACTVLA の前身(言語指示なしの模倣学習)・軽量・タスク特化(本番ライブ採用=3タスク統合の単一モデル)、③ GR00T N1.5〜N1.7 系(NVIDIA, 赤ペン掴み上げを実機検証)。いずれも SageMaker で学習。SmolVLA も検証
ロボットSO-101 ロボットアームフォロワー x2 + リーダー x1。Hugging Face LeRobot 系の安価な教育用アーム
センサ/環境俯瞰カメラ x1 / 手先カメラ x2OBR-WEBCAM200(俯瞰)、InnoMaker U20CAM-1080P(手先)。ChArUco でキャリブ済
LED 照明 x4USB 給電・常時点灯。外乱光を抑え VLA の動作を安定化。「クラウドから ON/OFF 制御」は構想のみで未実装

参考実装・ブログ

  • AWS Blog「Building intelligent Physical AI from edge to cloud with Strands Agents, Bedrock AgentCore, Claude 4.5, NVIDIA GR00T, and Hugging Face LeRobot」
  • Strands Labs ブログ(実験的なエージェント開発)
§04

通信フロー「消しゴムを片付けて」の一声が、ロボットを動かすまで

来場者が「消しゴムを片付けて」と話してから、ロボットが動き、成否を喋るまでの一連のシーケンス。

realtime_control_sequence.mmd
sequenceDiagram autonumber actor V as 来場者 participant APP as アプリ画面 participant AG as ボイスエージェント participant TTS as Qwen3-TTS
(SageMaker 推論EP) participant IOT as AWS IoT Core participant SR as Strands Robots(Thor) participant ARM as SO-101 フォロワー participant CAM as 俯瞰カメラ participant VLM as Bedrock VLM V->>APP: マイクに「消しゴムを片付けて」 APP->>APP: 音声をテキスト化 (STT) APP->>AG: 指示テキストを送信 AG->>AG: 指示を解釈・タスク選択 AG->>TTS: 応答テキスト(着手の返事) TTS-->>APP: 合成音声(お片付け幽霊) APP-->>V: 「やってみるあにょー」 AG->>IOT: アクションコマンドを publish IOT->>SR: コマンドを配信 (subscribe) SR->>SR: VLAに画像+指示を入力し推論 loop 推論ループ(数秒〜十数秒) CAM-->>SR: 手先/俯瞰カメラ映像 SR->>ARM: 関節角コマンド(USB) ARM-->>SR: 動作・状態 end SR->>IOT: 完了通知 publish IOT->>AG: 完了通知 AG->>CAM: 俯瞰画像を取得 CAM-->>VLM: 俯瞰画像 AG->>VLM: 「成功したか?」判定依頼 VLM-->>AG: 成功 / 失敗 alt 成功 AG->>TTS: 歓喜の言葉 TTS-->>APP: 音声 APP-->>V: 「片付いたあにょー!」 else 失敗 AG->>TTS: 謝罪+手伝い要請 TTS-->>APP: 音声 APP-->>V: 「失敗したあにょー…手伝って」 end

ポイント往復の節目だけクラウド

  • 音声指示 → クラウドで意図解釈 → MQTT でエッジへ司令 → エッジで VLA 推論しアーム制御、という往復。
  • VLA の推論ループ自体は エッジ内で完結(カメラ映像取得→関節角出力を反復)するため、クラウドとの通信は「司令」と「完了通知」の節目のみ。
  • 動作後の VLM 成否判定(図の下部)は 計画であり現コードには未実装(§02 実装版図 参照)。実装済みなのは「音声→Claude会話→MQTT→エッジ」までで、判定ループはまだ繋がっていない。
設計の勘所:なぜ「制御=エッジ/成否判定=クラウド」なのか

このシーケンスには性質の異なる2種類の推論が混在している。混同しないことが Physical AI 設計の要点。

リアルタイム制御ループ行動後の成否判定
中身カメラ映像→関節角を毎秒何十回も出力「片付いた?」を画像で1回だけ評価
遅延要件シビア 遅れると制御が破綻緩い 1〜2秒許容
置き場所必ずエッジ(Jetson 上の VLA)クラウドでも可(Bedrock VLM)
  • 制御ループをエッジに置く理由:カメラ→行動を高頻度で閉じる必要があり、クラウド往復の遅延やネット断が入ると制御が成立しない。だから VLA 推論は Jetson Thor 上でローカル実行する(このデモも実装済み)。
  • 成否判定をクラウドに置いてよい理由:動作完了後の "一発勝負" の評価で遅延に余裕がある。かつ「消しゴムがカゴに入ったか?」のような開放語彙の意味判断は大型 VLM(Claude/Nova 系)の方が得意で、エッジで動く VLA(行動を出すモデル)はこの用途には不向き。判定もクラウドにすれば、会話エージェント(AgentCore+Claude Haiku)と同じ場所で「画像を見る→判定→発話」が完結する。送る画像は JPEG 数十 KB で通信コストも小さい。
  • もしエッジで判定するなら:VLA とは別の判定用 VLM を Jetson にもう一つ載せる必要があり、Thor の VRAM を食い合う。利点はネット非依存・低遅延・呼び出しコスト0。トレードオフの関係にある。
  • 一般原則:Physical AI は「速い反射=エッジ/賢い思考=クラウド」で役割分担するのが定石(VLA の System1/System2 と相似)。詳説は教科書編第6章。
§05

来場者インタラクション3つのモードと3タスク ── 参加型の体験設計

アプリ画面を通じて、来場者は「お片付け幽霊」と対話しながら以下のモードを行き来する。会話の選択肢はマイク発話で選べ、フォールバックでマウス操作も可能。

interaction_modes.mmd
stateDiagram-v2 [*] --> 会話モード 会話モード --> VLAアクションモード: 「片付けて」等の指示 会話モード --> 手動操作モード: 「自分で動かしたい」とボイス指定 VLAアクションモード --> 成否判定: 動作完了 成否判定 --> 会話モード: 成功(歓喜) 成否判定 --> 手動操作モード: 失敗(謝罪し手伝い要請) 手動操作モード --> 会話モード: 体験終了 会話モード --> [*]

5.13つのモード

モード内容
会話モードお片付け幽霊と雑談。選択肢を画面表示し、来場者はマイク発話で選択(フォールバック:マウス)
VLAアクションモード音声指示で VLA がアームを自律制御。動作後に俯瞰画像を VLM 判定し、成功なら歓喜、失敗なら謝罪して手伝いを要請
手動操作モードVLA 失敗時、または来場者がボイスで明示指定した時に起動。手元の SO-101 リーダーアームを握ってフォロワーアームを直接操作(テレオペ体験)

5.2VLA が実演する3タスク

※ 各タスクの前に、展示員が手動で場をセットする運用。

  1. 消しゴムをカゴに片付ける(最も枯れたタスク。1 台のみで実行可能なので縮退運用の砦)
  2. マーカーを「S3 バケット」ペン立てにしまう(Amazon S3 をもじった小ネタ)
  3. サイコロを左右の腕で交互にお椀に向かって振る:振る前に来場者へ偶数/奇数を予想してもらい、振った後に VLM で出目を読み取り結果を報告(VLM の認識力を見せる演出)
重要な仕様変更

当初は「両手(双腕)同時動作」を想定していたが、VLA アクションは片腕のみ推論利用に変更(双腕学習は断念)。サイコロタスクは左右の腕を使うが、これは交互動作の演出。

5.3キャラクター演出「お片付け幽霊」

  • 音声合成は Qwen3-TTS(SageMaker 推論EP)によるボイスクローンで、独特のキャラボイスを当てている(語尾に「あにょー」が付く、ざわ…ざわ…的なノリ)。
  • 成功ボイス/失敗ボイスのバリエーションを用意し、デモの体験性とエンタメ性を高める。
§06

VLA 学習パイプラインロボット版 MLOps ── テレオペ収集 → クラウド FT → エッジ配信

デモの肝は「ロボットが学習で動く」こと。テレオペでの模倣学習データ収集 → クラウドで FT → エッジへ配信を回す。Sim2Real も組み込み予定。

補足:学習方式は強化学習ではなく模倣学習。Sim(Isaac Sim)は報酬で試行錯誤させる場ではなく、お手本データの自動生成・並列収集・事前検証に使う。

robot_mlops_pipeline.mmd
flowchart LR subgraph COLLECT["データ収集(実機テレオペ)"] LEADER["SO-101 リーダーアーム
人が操作"] FOLLOWER["SO-101 フォロワーアーム
追従"] REC["lerobot record
映像+関節角を記録"] LEADER --> FOLLOWER --> REC end subgraph SIM["Sim データ収集(Isaac Sim)"] ISAAC["Isaac Sim 上の SO-101
カメラ/グリッパを実機に合わせ再現"] end subgraph TRAIN["クラウド学習(AWS)"] S3DATA["Amazon S3
エピソードデータ"] SMT["SageMaker Training
π0.5 / ACT / GR00T を FT / g6.2xlarge"] MLF["SageMaker MLflow
Experiment 記録・Artifact"] S3MODEL["Amazon S3
学習済みモデル"] S3DATA --> SMT --> MLF SMT --> S3MODEL end subgraph DEPLOY["エッジ配信・推論"] SSM["AWS Systems Manager
ハイブリッド管理"] THOR["Jetson Thor
Strands Robots で推論"] GG["IoT Greengrass
自動配信(将来オプション)"] SSM -->|"send-command"| THOR end REC -->|"SSM 経由で S3 へ"| S3DATA ISAAC -->|"Sim2Real"| S3DATA S3MODEL -->|"モデル取得 (S3 presigned)"| THOR S3MODEL -.->|"将来"| GG GG -.->|"将来"| THOR THOR -.->|"実機推論 Artifact をトレース"| MLF

実装版 学習パイプライン(コード検証済み)

下図は shimatte-ai-training リポジトリの精読で確定した実装版。学習・研究系はすべて us-west-2(研究アカウント)で動作する。SageMaker Training で π0.5 / ACT / GR00T(N1.5〜N1.7 系)/ SmolVLA を学習し(ml.g5.2xlarge、GR00T のみ ECR カスタムイメージ)、SageMaker MLflow と Model Registry で管理する。学習済みモデルの IoT Greengrass によるエッジ配信は今後の構成(本デモ時点では未実装)本番ライブの実機には ACT を採用(π0.5・GR00T・SmolVLA も実機で検証)。強化学習(Isaac Sim + AWS Batch)は Phase5 の計画(破線)。

assets/training-pipeline.png(コード検証済み・us-west-2 研究アカウント)
しまってAI VLA 学習パイプライン実装版(us-west-2 研究アカウント)。テレオペ収集(SO-101 リーダー/フォロワー, LeRobot, 200エピソード, 2〜3カメラ) と Hugging Face のベースモデル(pi05_base/smolvla_base/GR00T-N1.5〜N1.7) を Amazon S3 へ集約。SageMaker Training Jobs で4モデル(π0.5/ACT/SmolVLA/GR00T, ml.g5.2xlarge, PyTorch, GR00T のみ ECR カスタムイメージ) を学習。SageMaker MLflow で実験記録、Model Registry へ自動登録、S3 にモデル成果物を保存。AWS Systems Manager(ハイブリッド管理)で Jetson AGX Thor へ配信(エッジが S3 から取得)。Greengrass 自動配信は将来オプション。強化学習(Isaac Sim + AWS Batch)は Phase5 計画(破線・未デプロイ)。

データ規模感

比較対象エピソード数収集時間(1エピ=30秒換算)
事前検証(消しゴムピック)20 エピソードでも動作約 10 分
本デモ目標50 エピソード約 25 分 + 照明バリエーション分
  • 学習のロバスト化のため、照明パターン(一部点灯・全点灯・全消灯)を変えてデータにバリエーションを持たせる。
  • 学習の全工程は 学習ダッシュボード(CloudFront 配信、後述)で可視化し、当日はこの画面で「VLA がどう学習されるか」を説明する。
  • Sim2Real:Isaac Sim 上に Sim 版データ収集環境を構築(標準 SO Arm から手首カメラ・マウンタ・グリッパを実機仕様に変更)。実機データ収集の労働集約性を補う狙い。
§07

物理レイアウトと現場の3画面構成ミニチュアハウスと、来場者が見る3つのスクリーン

7.1ブース物理レイアウト

booth_layout.mmd
flowchart TB subgraph CASE["筐体:アルミフレーム 97x65x65cm(側面はベニヤ/プラダンで遮光・前面は開放)"] TOP["天面:ベニヤ板+LEDバーライト
LED照明 x4(上から照射)/俯瞰カメラ x1"] FA1["SO-101 フォロワー FA1
+手先カメラ"] FA2["SO-101 フォロワー FA2
+手先カメラ"] DESK1["作業台①
消しゴム・カゴ・サイコロ・お椀"] DESK2["作業台②
マーカー・ペン立て"] FLOOR["床:黒画用紙(元の机)"] TOP --> FA1 TOP --> FA2 FA1 --> DESK1 FA2 --> DESK2 DESK1 --- FLOOR DESK2 --- FLOOR end subgraph FRONT["手前(来場者側の機材)"] LEADER["リーダーアーム
ディスプレイ台にクランプ(テレオペ用)"] APP["アプリ画面
来場者が対話(筐体裏ディスプレイ)"] THOR["Thor画面・PCモニタ
カメラ映像を常時表示"] SLIDE["展示説明画面
HTMLスライド+QR(筐体横)"] end CASE ==> FRONT
寸法の経緯

当初 700×700×900mm を検討したが、SO-101 の到達範囲だと壁に当たるため拡大。最終的に 97×65×65cm に確定(上面図では 640×940mm)。フレームはミスミ HFS6-3030 系、π字金具・L字金具で接合、天板は 900×600 ベニヤ/低発泡塩ビ、側面はベニヤ/プラダン、床は元机に黒画用紙。

7.2現場の3画面構成

画面設置場所表示内容
アプリ画面筐体裏の備付ディスプレイ来場者が「お片付け幽霊」と対話する UI。会話の選択肢表示、マイク入力
Thor画面持込 PC モニタ操作中のカメラ映像を常時表示(ロボットが今何を見ているか)。Isaac Sim の位置表示も検討
展示説明画面筐体横ディスプレイ展示概要・アーキ図・データ取得・シミュレータ・AWS説明・VLA/基盤モデル説明を HTML でループ。QR から該当ページ、PDF も配布
§08

ハードウェア部品表アーム等 総額 3〜4 万円規模 + Jetson Thor 約 50 万円台

// bill of materials(主要)
分類品目仕様・型番備考
ロボットSO-101 アーム x2Hugging Face LeRobot 系フォロワー。実売 4 万円級 + 3Dプリント部品 ~6,000円
ロボットSO-101 リーダーアーム x1手動操作・テレオペ用。ディスプレイ台にクランプ
エッジJetson AGX Thor 開発者キット945-14070-0080-000 / 約 53.3 万円(税抜)NVMe 1TB SSD。Orin(64GB 約 31.9 万円)から変更
カメラ俯瞰カメラ x1OBR-WEBCAM200-K(640x480, FOV対角 49.9°, f6.45mm)ChArUco でキャリブ済
カメラ手先カメラ x2InnoMaker U20CAM-1080P(640x480, FOV対角 72.5°, f3.07mm)広角・糸巻き歪み
筐体アルミフレームミスミ HFS6-3030-885-LDV-RDV x4 + HFS6-3030-885 x1(梁)π字金具 HSJNS6 で接合
筐体天板900x600 ベニヤ板 / 低発泡塩ビ フォーレックス溝にはめ込み
筐体側面・背面板ベニヤ / プラダン外側から固定
照明LED バーライト x4USB 給電(Amazon の安価品)高さ 80cm から照射。白飛びはゲイン調整
3Dプリントカメラマウンタ x4SO-ARM101_camera_wrist_mount.stlTheRobotStudio/SO-ARM100
3DプリントソフトフィンガーXLeRobot SO101_soft_fin.stl爪先 TPU 95A(柔軟把持)+ その他 PLA
3DプリントSO-101 3030 ブラケット自作設計アームを 3030 フレームに固定。後方オフセットで梁へのモーメント低減
その他パネルクランプ / USB Hub / 電源タップ / 黒画用紙 / 作業台 x2
  • 総額は 3〜4 万円規模(Jetson Thor を除く本体・3Dプリント部品・アルミフレーム・カメラ・照明等)。
  • 電源は SO-101 用 AC アダプタ 4 並列がフレームにジャストフィット。
§09

デモの訴求ポイントSA 視点 ── このデモで何が語れるか

訴求 01
Edge-to-Cloud Physical AI

クラウドの知能(会話・VLM 判定)とエッジのリアルタイム制御(Thor 上の VLA)を IoT Core の MQTT で疎結合。「考えるのはクラウド、動くのはエッジ」という王道アーキを 1 デモで体現。

訴求 02
Strands Agents / Robots

会話エージェント(Strands Agents)とロボット制御(Strands Robots = lerobot ラップ)を同一フレームワークで統一的に扱える実機事例。AWS の新エージェント基盤の Physical AI 応用。

訴求 03
VLA × 模倣学習 ロボット版 MLOps

テレオペ収集 → S3 → SageMaker FT → MLflow → Systems Manager + S3 でエッジ配信。MLOps を物理世界に拡張した一気通貫。ダッシュボードで「学習で動く」過程を可視化。

訴求 04
VLM クローズドループ

行動後に俯瞰画像を VLM で評価し成否を自己判定。失敗時は助けを求める。単発再生でなく知覚-行動-評価のループが技術的見どころ。計画

訴求 05
Sim2Real

実機データ収集の労働集約性を、シミュレーションデータで補完。Isaac Sim で Sim と Real を並列収集する設計。

訴求 06
観測性 Observability

SageMaker MLflow で各学習を Experiment 記録、実機推論時の Artifact までトレース。「再現性のある ML」を物理 AI でも担保。

訴求 07
コストの民主化

実売 4 万円級の SO-101(+推論用 Jetson Thor は別途約 50 万円台)でも、AWS のマネージドサービス群だけで企業級 Physical AI デモが構築できる。アーム自体は安価で、AWS のマネージドサービスで同等の構成が組める。

訴求 08
体験性・エンタメ性

音声対話 + キャラ(お片付け幽霊)+ 手動操作(テレオペ)体験で来場者参加型。技術的な硬さを和らげ、立ち寄りやすいブースに。

訴求 09
継続訴求(LTV)

展示終了後も継続的な訴求材料として再利用できる。安価な構成で先進的な Physical AI 体験を AWS 上で実現できることの証明になる。