NVIDIA Nemotron 3.5 Lightning
高速推論とツール呼び出しを必要とする開発者向けに、長時間稼働するエージェントをカスタマイズ可能な環境で動かすためのNVIDIA製オープン30BハイブリッドMoEモデルです。
ツール概要
採用判断としては、ローカル推論やモデルの制御を重視するチームなら試す価値がありますが、現時点の証拠だけで本番環境の標準モデルにするのは早いでしょう。主な狙いは、一般的なチャットの完成度を最大化することよりも、高速な推論、ツール呼び出し、長時間動作するエージェントです。したがって、導入前に自社のタスク、ツール連携、失敗時の復旧フローで小規模な評価を行うのが妥当です。
実際には、約30Bパラメータのうち約3BをアクティブにするハイブリッドMoE言語モデルです。1トークンごとの計算量を抑えながら、ツールを使う自動化や継続的なエージェント処理を狙った構成と説明できます。NVIDIAの投稿は、重み、データ、レシピを公開し、カスタマイズできるとしています。OpenRouterとOllamaの投稿からは、それぞれの提供経路やローカル実行環境で利用可能になったことが確認できます。NVIDIA RoboticsはJetson AGX Thorで平均115 tokens/sと述べていますが、これは特定条件に関する公式SNS上の主張であり、すべての端末、量子化設定、プロンプト、処理内容で再現する保証ではありません。
費用について、提示された資料には公式API価格、ホスティング料金、最低ハードウェア要件、普遍的なレイテンシー保証がありません。自前運用では、計算資源、メモリやVRAM、モデルの取得、量子化、ランタイム互換性、監視と保守の費用が発生すると考えるのが安全ですが、これは一般的な推測であり、NVIDIAの価格情報ではありません。OpenRouterを使えば運用の手間を減らせる可能性はありますが、価格や利用枠はこの証拠から判断できません。エージェント用ツールチェーンを研究する開発者、ローカル実行を試したい人、モデルを自分で管理したいチームには向きます。一方、デプロイや評価をせず、すぐ使えるチャット画面だけを求める人には向きません。
これは完成済みのエージェント製品、コードIDE、あるいはClaude Codeのようなホスティングサービスではありません。より正確には、Ollama、OpenRouter、または自前の推論基盤から呼び出すモデル基盤です。ランキング情報ではXで18件の言及、約178.9万回の閲覧、7,544件のエンゲージメントが記録されており、注目度は確認できますが、使いやすさの証明ではありません。能力に関する材料は、NVIDIA、OpenRouter、Ollamaの告知と、少数の先行利用・DGX Sparkデモが中心です。ある実測投稿はエージェントや動画編集タスクを評価しつつ、コーディングは平凡と述べ、別の投稿はエージェント型コーディングの精度と速度の優位性を紹介しています。