Hy3 (テンセント フンユアン 3) 無料

-

Hy3 (Tencent Hunyuan 3) は、Tencent Hunyuan チームによって開始された第 3 世代のハイブリッド エキスパート (MoE) 大規模言語モデルです。合計パラメータは 295B、アクティベーション パラメータは 21B、192 のエキスパート トップ 8 ルート、256K のコンテキスト ウィンドウ、およびオープン ソースの Apache 2.0 ライセンスを備えています。 SWEベンチ検証では74.4%、GPQAダイヤモンドでは90.4%に達します。強力なコード生成、ツール呼び出し、エージェント機能を備えており、50 を超える Tencent 社内製品に適用されています。

Hy3 (テンセント フンユアン 3) 製品インターフェース

Hy3 (Tencent Hunyuan 3): オープンソース MoE 大規模モデルのエージェントとコード機能のベンチマーク

Hy3 のコアパラメータと統計

Hy3 (Hunyuan 3) は、Tencent の Hunyuan チームによって開始された第 3 世代の Mixture-of-Experts (MoE) 大規模言語モデルです。これは、Tencent のこれまでで最も強力で最もオープンな基本モデルでもあります。前世代の Hy2 と比較して、Hy3 はパラメータの大きさ、エキスパート スケール、コンテキストの長さ、推論機能において世代を超えたアップグレードを実現しました。 Apache 2.0 ライセンスに基づく完全なオープンソースであり、地理的な制限はありません。

プロジェクト 仕様
製品名 Hy3 (Hunyuan 3 / Tencent Hunyuan 第三世代)
製品タイプ 基本大型モデル (MoE)
合計パラメータ 295B (MTP層を含む299B)
アクティベーションパラメータ 21B
MTP レイヤパラメータ 3.8B
専門家の数 192 人の専門家、トップ 8 のルーティング
ネットワーク層の数 80層(MTPを除く)
注目のヘッド 64 (GQA、8 KV ヘッド、ヘッド寸法 128)
隠れ層の寸法 4096
中間層寸法 13312
コンテキストウィンドウ 256,000 トークン
語彙のサイズ 120,832
サポート精度 BF16/FP8
ライセンス契約 アパッチ2.0
納品形態 オープンソースの重み (HuggingFace / ModelScope) + API (OpenRouter およびその他のサードパーティ)
ホーム CN (テンセント)
サポートされている言語 中国語、英語
発売日 プレビュー: 2026 年 4 月 23 日;全文: 2026-07-06

Hy3 は全知全能の一般的なモデルとして位置付けられるのではなく、「特定のパラメーターの予算の下で最高の推論品質を追求する」。 21B アクティベーション パラメーターでは、推論の実行時にネットワークの約 4.2% (192 人中 8 人の専門家) が計算に参加する必要があるだけで、同じインテリジェンス レベルの高密度モデルよりも導入コストが大幅に低くなります。 256K コンテキスト ウィンドウは、一度に約 384 ページの A4 ドキュメントを処理でき、長いドキュメントの分析やファイル間のコード ベースの理解に適しています。

効率向上の実際の意味: 21B のアクティベーション パラメーターと 100B+ のアクティベーション パラメーターを持つ他のモデルと比較して、Hy3 は推論スループットにおいて当然の利点を持っています。 vLLM または SGLang を使用してデプロイすると、単一推論のメモリ使用量とトークン生成遅延は、同じインテリジェンス レベルの高密度モデルよりも低くなります。高頻度の API 呼び出し元の場合、これはトークン価格の低下とバッチ処理の待ち時間の短縮に直接反映されます。

推論モード設計: reasoning_effort の 3 つの制御レベルをサポートします - no_think (単純なモード、翻訳や要約などの決定論的なタスクに適しています)、low (軽い思考、通常の質疑応答に適しています)、high (深い連鎖推論、数学的証明、競技プログラミング、複雑なエージェント計画に適しています)。 「高」モードを選択すると、トークンの出力量が 3 ~ 8 倍に増加し、それに応じて 1 回の呼び出しのコストも増加します。

Hy3 のユーザーと市場の認知度

Hy3 の市場認識は、「テンセントの社内生産検証 + オープンソース コミュニティの評判」という両輪駆動パターンを示しています。

社内生産規模: Hy3 は正式リリース前に Tencent の 50 以上の社内製品ラインに統合されており、WeChat、QQ、Tencent Cloud、ゲーム プラットフォームなどのコア ビジネスをカバーしています。このレベルの内部展開は、モデルが実際のトラフィックと複雑なビジネス ロジックによってテストされていることを意味します。これには、マルチラウンド対話の安定性、長いコンテキストの減衰制御、多言語の混合、実稼働環境で磨き上げられたその他のエンジニアリング上の課題が含まれます。

オープンソース コミュニティの反応: 2026 年 7 月の時点で、GitHub の「Tencent-Hunyuan/Hy3」ウェアハウスは 530 個以上のスター、120 個以上のフォークを受け取り、HuggingFace でのモデルの重みの月間ダウンロードは 14,000 回を超えています。 Hy3 を中心としたコミュニティは、10 を超える微調整されたバリアントと 65 を超える量子化バージョン (llama.cpp、LM Studio、Jan などのツール チェーンをサポート) を作成しており、15 の HuggingFace Spaces がオンライン エクスペリエンスの入り口を提供しています。

第三者による評価パフォーマンス: Artificial Analysis の Intelligence Index では、Hy3 は 41 点 (合計 97 のモデル比較) で超大規模パラメータ スケールのオープンソース モデルの中で 8 位にランクされ、カテゴリ中央値の 25 点を大幅に上回りました。主なベンチマーク スコアは次のとおりです。

  • GPQA ダイヤモンド: 90.4% (知識推論、オープンソース モデルのトップレベル)
  • SWE ベンチ検証済み: 78% (実際のコーディング タスク解決率)
  • SWE-bench Pro: 57.9% (複雑なエンジニアリング タスク)
  • 人類最後の試験: 53.2% (総合知識チャレンジ)
  • Deep-SWE: 28% (独立したコード修復)
  • Apex エージェント: 25.6% (エージェント タスク)
  • LHTB (長期ターミナルタスク): 28.8% (長期エージェントタスク)

ブラインドテストの専門家による評価: Tencent は 270 人の業界専門家と共同でブラインドテストを実施しました。 Hy3 は総合スコア 2.67/4 を獲得し、GLM-5.1 の 2.51/4 を上回りました。最大の利点は、フロントエンド開発、データ ストレージ、CI/CD タスクに集中しています。この結果は、単一のベンチマークよりも実際のシナリオにおけるモデルの有用性をよりよく反映しています。

Hy3 のコスト上の利点

Hy3のコスト構造は「Apache 2.0オープンソースのライセンス料ゼロ+アクティベーションパラメータの推論効率の低さ+サードパーティAPIの低価格」の3層で構成されている。これは、現在最もコスト効率の高いオープンソースの大規模モデルの 1 つです。

C クライアント/個人ユーザー: HuggingFace (tencent/Hy3) を通じてモデルの重みを完全に無料で直接ダウンロードします。個々の開発者は、ライセンスや API 料金を支払うことなく、独自のハードウェアで推論を実行できます。ただし、GPU コンピューティング能力のコストは自分で負担する必要があります。8×H20-80G または同等の構成で Hy3 の全精度推論を実行するには、1 回のハードウェア投資で数万元から数十万元のオーダーになります。時々使用するシナリオでは、サードパーティ API を使用した分だけ支払う方が経済的です。

開発者/API 呼び出し (OpenRouter を例にします):

課金アイテム 価格 (USD/100万トークン) 比較参考
入力 (キャッシュヒット) $0.035 (-75% 割引) クロード・ソネット 5: $3/M
入力(標準) $0.14 GPT-5.6: ~$15/月
出力 $0.58 Grok 4.5: 6 ドル/月
混合価格 (7:2:1 の比率) 約$0.11 DeepSeek V4 フラッシュ: 約。 $0.08

Hy3 の API 価格は、同様のインテリジェンス レベルのクローズドソース モデルの約 1/10 ~ 1/50 です。 1 日あたり 100 万のトークン入力と 500,000 のトークン出力を処理する軽量アプリケーションの場合、月額コストはおよそ (0.14 ドル × 30 + 0.58 ドル × 15) = 12.9 ドル/月で、これはほとんど無視できます。

エンタープライズ/プライベート展開: オープン ソースの重量は無料 (Apache 2.0) ですが、インフラストラクチャ コストはかかります。8×H20-80G サーバーを参考にすると、単一ユニットの月額レンタル コストは約 8,000 ~ 12,000 ドル (エビアンのメーカーと契約期間は変動します) で、適度な同時 Hy3 推論をサポートできます。企業の総コストは、「API の年間料金とプライベートの 3 年間のコスト TCO」モデルに基づいて評価する必要があり、運用および保守の人件費、モデル バージョンの反復更新、定量的な展開 (FP8 によりビデオ メモリ要件がさらに削減される) などの隠れたコストを含める必要があります。

購入のヒント: API の価格は、各サービス プロバイダーのリアルタイム ページに基づいています。地域によって価格に違いがあります(中国本土と海外など)。プライベート デプロイメントに推奨されるハードウェア構成とパフォーマンス インジケーターは、GitHub リポジトリのデプロイメントの章に基づいています。

Hy3の主な機能

Hy3 の機能設計は、「コード生成 + エージェント ツール呼び出し + 深い推論 + ロング コンテキスト」の 4 つのコア機能ラインを中心にしています。

  • コード生成とエンジニアリング タスク: Python、JavaScript/TypeScript、Java、Go などの主流言語のコード生成、完成、リファクタリング、バグ診断、単体テストの生成をカバーします。 SWE ベンチ検証済みの解決率 78% は、モデルが実際の G​​itHub 問題の説明を理解し、関連するコード ファイルを見つけて、マージ可能な修正を提案できることを意味します。 実装のヒント: 複雑なエンジニアリング タスクの場合は、「reasoning_effort=high」モードを有効にすることをお勧めします。ストレートアウトモードでは、境界条件の処理が見逃される可能性があります。

  • エージェント ツール呼び出し (関数呼び出し): Hy3 のツール呼び出し機能は、このアップグレードの中核となるハイライトです。このモデルは、複数ラウンドのツール呼び出し、エラー回復、およびクロスエージェント フレームワークの一般化をネイティブにサポートしています。SWE ベンチ検証の精度は、さまざまなスキャフォールド (CodeBuddy、Cline、KiloCode) の下で 4% 以内で変動します。 ツールオープンリスト: navigate (Web ページナビゲーション)、click (クリック要素)、type/input (テキスト入力)、screenshot (ページのスクリーンショット)、extract (情報抽出)、wait (待機条件)、read_file/write_file (ファイルの読み取りと書き込み)、execute_command (コマンドの実行)、finish などの標準ツール動作をサポートします。 (タスク終了レポート)。アーキテクチャ リンク: 「LLM (Hy3) → API/MCP サーバー → ツール実行環境 → 観察から LLM が返される」。「計画 → 実行 → 観察 → 調整」のインタラクティブな閉ループを形成します。

  • 深い推論と思考連鎖: 調整可能な思考連鎖推論をサポートします。知識質問応答 (GPQA ダイヤモンド 90.4%) および複雑な推論タスク (人類最後の試験 53.2%) において、オープンソース モデルのトップレベルに達しました。内部レビューによると、Hy3 の幻覚率は Hy3 プレビューの 12.5% から 5.4% に低下し、常識誤り率は 25.4% から 12.7% に低下し、事実の正確さと論理的一貫性が大幅に向上しました。

  • Long context understanding (256K tokens): Can process about 384 pages of text content at a time, suitable for scenarios such as legal contract set review, global analysis of large code bases, long conversation history understanding, etc. Through the joint optimization of SFT and RL, the rate of referential resolution, omission recovery, and constraint inheritance problems in multi-round conversations is reduced from 17.4% to 7.9%. 実装のヒント: 長いコンテキストのシナリオでは、推論レイテンシーと KV キャッシュのオーバーヘッドが大幅に増加します。 It is recommended to enable full context in tasks that really require cross-chapter correlation, and control daily tasks within 32K to balance costs.

  • Multi-modal extension: The core of Hy3 is a text model, but it can be extended to image and text understanding through Tencent's visual language model pipeline.ネイティブの Hy3 加重ビジュアル モードはサポートされていないため、プレーン テキスト シーンではこの制限に注意を払う必要はありません。

  • Engineering optimization tool chain: Provides a complete fine-tuning (Finetune) pipeline (based on vLLM/SGLang), RL post-training (GRPO via verl + Megatron-LM + vLLM rollout) and quantization tools (AngelSlim supports common quantization algorithms, low-bit quantization, and speculative sampling).開発者は、Hy3 の重みに基づいて垂直ドメイン固有のモデルを構築できます。

Hy3 モデルとバージョンの進化

Hy3 のバージョン反復は、「プレビュー検証 → フィードバック収集 → フルリリースの最適化」のリズムに従います。

メインライン リリース

  • Hy2 (~2025-12): Hunyuan second-generation model, SWE-bench is about 53.0%, laying a baseline for Hy3’s MoE architecture upgrade.公式の正確な発売日はまだありません。
  • Hy3 プレビュー (2026-04-23): 295B MoE (21B アクティベーション) アーキテクチャと 192 のエキスパート Top-8 ルーティングを初めて使用した、新しいインフラストラクチャ上のトレーニング モデルの最初のバッチ。 SWE-bench Verified reached 74.4%, attracting the attention of the developer community. After the release, Tencent collected 50+ internal product usage feedback.
  • Hy3 Full (2026-07-06): Large-scale post-training optimization based on Preview feedback.主な改善点は次のとおりです。
    • Tool calling stability and error recovery capabilities have been significantly improved
    • Illusion rate reduced from 12.5% to 5.4%, common sense error rate reduced from 25.4% to 12.7%
    • Multi-turn conversation intent tracking issue rate reduced from 17.4% to 7.9%
    • The output is more concise while keeping complex intentions from decaying in long-distance interactions
    • Simultaneous release of FP8 quantitative version (Hy3-FP8) to lower the deployment threshold

候補者の検証

  • Hy3-FP8 (フルと同日リリース): AngelSlim ツール チェーンで動作する FP8 の量子化バージョン。これにより、推論の品質を維持しながらグラフィックス メモリ要件が大幅に削減され、より多くの開発者が限られたハードウェアで Hy3 を実行できるようになります。

Release Notes: Hy3's open source policy is released under the Apache 2.0 license, with no additional terms and no geographical restrictions. The weights of the old version (Hy2) have also been made public via the Tencent HuggingFace organization page. Subsequent version iteration plans are subject to information released by the GitHub warehouse and official Twitter/X account.

Hy3 の技術的利点

Hy3 の技術的ルートの選択は、「限られた計算能力予算の下で推論の品質を最大化する」という Tencent のエンジニアリングの蓄積を反映しています。

MoE アーキテクチャと 192 のエキスパート トップ 8 ルーティング: Hy3 の MoE は、単にエキスパートの数を増やすだけではなく、80 層の Transformer の層ごとに 192 のエキスパート サブネットワークを展開し、そのうちの 8 つだけがトークンごとにアクティブ化されます (アクティブ化率約 4.2%)。これは、295B 個のパラメーターのうち 21B のみが推論の各ステップに参加し、推論の計算量を制御しながら広範な知識を保存することを意味します。さまざまなトークンがさまざまなエキスパートにルーティングされます。コード トークンはコード専門知識のエキスパートをアクティブにする傾向があり、自然言語トークンは言語専門知識のエキスパートをアクティブにし、暗黙的なタスク パーティションを形成します。

MTP レイヤー (マルチタスク予測レイヤー): 3.8B パラメーターの共有 MTP レイヤーは、さまざまなエキスパートの出力を調整し、さまざまなトークンがさまざまなエキスパートによって処理された場合でも、シーケンス全体がセマンティックな一貫性を維持できるようにします。これは、Hy3 が複雑な複数ステップの推論で安定した出力を維持するための重要なメカニズムです。

推論の労力: モデルは、「reasoning_effort」パラメータを通じて「速度」と「深さ」の間で動的に調整できます。 「no_think」モードでは、モデルは直接答えを生成するため、遅延に敏感なシナリオに適しています。 「高」モードでは、モデルは完全な連鎖推論を展開します。この設計により、複数のバージョンを導入することなく、同じモデルの重みを異なる遅延バジェットの下で適応的に調整できます。

ポストトレーニング パイプライン (SFT + RL): Hy3 の SFT および GRPO 強化学習パイプラインは verl + Megatron-LM フレームワーク上で実行され、大規模な分散トレーニングをサポートします。トレーニング後のデータ品質と多様性の向上が、Hy3 プレビューからフル バージョンに品質が飛躍的に向上した主な理由です。内部評価では、共同最適化による幻覚率、常識誤り、および複数ラウンドの一貫性に対する効果が重要であることが示されています。

プロダクション グレードのツール呼び出しの安定性: Hy3 は複数のベースライン信頼性の問題を修正し、さまざまな構成や出力制約の下でツール呼び出しをプロダクション グレードの標準に引き上げます。さまざまなエージェント フレームワーク (CodeBuddy、Cline、KiloCode) でのモデルの SWE ベンチ検証済み精度の分散は 4% 以内にとどまっており、ツール呼び出し機能が特定のフレームワーク実装に束縛されていないことを示しています。

エンジニアリング デプロイメント アダプテーション: Hy3 には、2 つの主流推論エンジン vLLM および SGLang に対する公式アダプテーション ソリューションがあり、MTP 投機的デコード アクセラレーションをサポートしています。導入時には 8×H20-80G 以上のメモリ GPU を使用することをお勧めします。 FP8 量子化バージョンでは、メモリ要件をさらに削減できます。定量化ツール AngelSlim は Tencent によってオープンソース化されており、一般的な量子化アルゴリズムと低ビット量子化をサポートしています。

パフォーマンスとスループットの参考: Artificial Analysis による実測によると、サードパーティ API での Hy3 の出力速度の中央値は約 60.3 トークン/秒 (カテゴリ中央値の 64.2 よりも低いですが、その差は大きくありません)、TTFT (最初の単語遅延) 中央値は約 2.65 秒 (カテゴリ中央値の 1.83 秒よりわずかに高い) です。具体的な値は、導入ハードウェア、定量化方法、同時実行性に応じて異なり、実際のテストの対象となります。

Hy3 の適応境界とシーンの制約

得意分野: コード生成とエージェント タスク、数学的推論と知識の質問と回答、中国語と英語のバイリンガル処理、ツール呼び出し、および複数ステップの計画。

苦手な点: 英語のドキュメント スタイルの細かさは、純粋な英語のトレーニング モデルよりもわずかに低くなります。西洋のロングテールのフレームワークやツールへの馴染みは、DeepSeek のような環境的に成熟したモデルほどよくありません。視覚的なモダリティはサポートされていません (純粋なテキスト モデル)。超長いコンテキスト (256K の制限に近い) シナリオでは、推論の遅延が大幅に増加します。

競合製品との比較:

比較 Hy3 ディープシーク V4 プロ GLM-5.2 クロード・ソネット 5
合計パラメータ 295B 1.6T 744Bについて 未公開
アクティベーションパラメータ 21B 約49B 約1000億円以上 未公開
コンテキスト 256K 1M ~256K ~200K
ライセンス アパッチ2.0 マサチューセッツ工科大学 マサチューセッツ工科大学 クローズドソース
API 入力価格 $0.14/月 1~3円/月 $0.5-1/月 3ドル/月
SWEベンチ 78% 約75% 約62% 約70%

Hy3 の主な利点は、最小のアクティベーション パラメータと Apache 2.0 の完全なオープン ライセンスで最強の SWE ベンチ パフォーマンスを達成できることです。欠点は、生態学的成熟度が DeepSeek ほど高くなく、1M の超大規模コンテキスト シーンがまだカバーされていないことです。

Hy3の使い方

Hy3 は、「オープンソースのセルフホスティング + サードパーティ API」の 2 つの使用モードを提供し、個人的な実験からエンタープライズレベルの展開までのすべてのシナリオをカバーします。

使い方 人に適しています 特長 コスト
サードパーティ API (OpenRouter など) 開発者、小規模チーム すぐに使用可能、GPU は不要 従量課金制 (M トークンあたり $0.14/$0.58)
セルフホスティング (vLLM) エンタープライズ、技術チーム データはドメインの外に出ず、フル コントロール GPU コンピューティング コスト
セルフホスト (SGLang) エンタープライズ、技術チーム 正式適応、MTP加速 GPU コンピューティング電力コスト
ハグ顔の重さのダウンロード 研究者、モデル開発者 微調整・定量化・二次開発 無料 (ハードウェアをご持参いただく必要があります)

API クイック スタート (OpenAI SDK と互換性のある OpenRouter):

「」パイソン openaiインポートからOpenAI

クライアント = OpenAI( Base_url="https://openrouter.ai/api/v1", api_key="", )

応答 = client.chat.completions.create( モデル = "テンセント/hy3", メッセージ=[ {"role": "user", "content": "Python を使用して、キャッシュされたフィボナッチ数列計算を実装します。"} ]、 温度=0.9、 トップ_p=1.0、 extra_body={ "chat_template_kwargs": {"reasoning_effort": "高"} } ) print(response.choices[0].message.content) 「」

重要なパラメータの説明: 「温度」は 0.9、「top_p」は 1.0 が推奨されます。 reasoning_effort は、オプションの no_think (単純な思考)、low (軽い思考)、high (深い推論) です。コードや複雑な推論シナリオには「高」モードを使用することをお勧めします。

セルフホスト - vLLM 導入 (8 GPU を推奨):

「」バッシュ

最初に vLLM をコンパイルしてインストールする必要があります (ソース コードに基づいて)

エクスポート VLLM_FLASHINFER_ALLREDUCE_BACKEND=trtllm vllm は Tencent/Hy3 を提供します \ --tensor-Parallel-size 8 \ --speculative-config.method mtp \ --speculative-config.num_speculative_tokens 2 \ --tool-call-parser hy_v3 \ --reasoning-parser hy_v3 \ --自動ツール選択を有効にする \ --ポート 8000 \ --提供モデル名 hy3 「」

セルフホスト - SGLang 導入:

「」バッシュ python3 -m sglang.launch_server \ --モデル テンセント/Hy3 \ --tp-サイズ 8 \ --tool-call-parser フンユアン \ --reasoning-parser フンユアン \ --speculative-num-steps 2 \ --speculative-eagle-topk 1 \ --speculative-num-draft-tokens 3 \ --投機的アルゴリズム EAGLE \ --ポート 8000 \ --提供モデル名 hy3 「」

導入が完了すると、OpenAI 互換インターフェイスを介してローカル サービスを呼び出すことができます。詳細な展開ドキュメントは、GitHub リポジトリ「Tencent-Hunyuan/Hy3」の README の対象となります。

Hy3 の製品価格

Hy3 の価格設定は、「オープンソースの重量フリー + サードパーティ API の従量課金制」モデルを継続しています。

オープンソースの重要性: Apache 2.0 ライセンス、使用制限なし、地理的制限なし、商用利用の制限なし。ユーザーは自由にダウンロード、使用、改変、再配布することができます。 Meta の Llama コミュニティ ライセンスとは異なり、Hy3 では商用ライセンスを追加で申請する必要はありません。

サードパーティ API の価格: OpenRouter の中央価格に基づいて、0.14 ドル/100 万トークンを入力し、0.58 ドル/100 万トークンを出力します。キャッシュ ヒットの 75% 割引 (100 万トークンあたり 0.035 ドル)。さまざまなサービス プロバイダー (Fireworks AI、Togetter AI など) の価格は若干異なる場合があり、各プラットフォームのリアルタイム ページに応じて異なります。

プライベート導入コスト: ウェイトは無料ですが、インフラストラクチャのコストはお客様ご自身で負担する必要があります。 8×H20-80G または同等の GPU を構成することが推奨されており、1 台の月額レンタル費用は約 8,000 ~ 12,000 ドルです。 FP8 定量バージョン (Hy3-FP8) は、同じハードウェア上でより高い同時実行性を実現したり、ハードウェアのしきい値を単一カード A100-80G に下げることができます (実験シナリオのみ)。

Enterprise Volume Purchase: Tencent は、Hy3 の正式なホスティング API 価格を明らかにしていません。大規模なトラフィック シナリオの場合は、「[email protected]」を通じて Tencent チームに連絡してビジネス ソリューションを入手するか、OpenRouter などのプラットフォームでのエンタープライズ レベルの契約に基づいて割引を交渉することをお勧めします。

Hy3 アプリケーションのシナリオ

Hy3 のアプリケーション シナリオは、ソフトウェア開発、エージェント自動化、知識集約型分析、企業の生産性向上の 4 つの側面にまたがっています。

  • ソフトウェア開発 (コード生成およびエンジニアリング タスク): これは、Hy3 にとって最も強力なシナリオです。コードの補完、バグの特定と修復、単体テストの生成、コード レビュー、リファクタリングの提案、技術文書の作成などをカバーします。SWE ベンチ検証済みの 78% のパフォーマンスは、Hy3 が複雑な GitHub 問題の説明を理解し、マージ可能な修正コードを生成できることを意味します。 実装のヒント: ツール呼び出し機能を最大限に活用するには、CodeBuddy、Cline、KiloCode などのエージェント フレームワークと組み合わせて使用​​することをお勧めします。複雑なエンジニアリング タスクの場合は、「reasoning_effort=high」モードを有効にします。

  • AI エージェントと自動化されたワークフロー: Hy3 のツール コールの安定性は、50 を超える Tencent 社内製品によって検証されています。 Web ページの自動化 (情報収集、フォーム入力)、コマンド ライン ツール チェーンの配置、複数ステップのデータ処理パイプライン、その他のシナリオに適しています。 アーキテクチャ リンク: LLM(Hy3) → ツール パーサー → 関数実行 → 観察 → LLM 再計画エンジニアリング上の落とし穴に関するガイド:

    1. 無限ループとトークン インフレーション制御: max_steps パラメーターを通じて実行ラウンドの最大数を制限し (10 ~ 20 を推奨)、反復アクション検出 (3 連続ステップで同じ観測が返されたときに終了) と組み合わせてシングルステップ タイムアウトを設定して、モデルのアイドリングを防ぎます。
    2. DOM/コンテキストのオーバーロード: Web ページのエージェント タスクの場合は、HTML ドキュメント全体がコンテキスト ウィンドウに表示されないように、スクリーンショットの配信を無効にし、アクセシビリティ ツリーまたは DOM の概要のみを返すことをお勧めします。
    3. セキュリティと超権限ガバナンス: モデルからの誤操作を防ぐために、元に戻せない操作 (ファイルの削除、メッセージの送信、支払い、公開) の確認ポイント (人間参加者) を設定するか、実行環境で読み取り専用モードで開始します。
  • 知識の質問と文書分析: GPQA Diamond の 90.4% というパフォーマンスは、Hy3 が知識集約型タスクにおいて最先端のクローズドソース モデルに近いことを示しています。 256K コンテキストは、長い学術論文のレビュー、法的契約条件の比較、技術的なホワイト ペーパーの要約などのシナリオに適しています。 実装のヒント: ドキュメント分析シナリオでは、「reasoning_effort=no_think」または「low」モードを使用してください。深い推論を有効にする必要がないため、レイテンシとトークンの消費を削減できます。

  • 企業の生産性 (内部ツールと RAG システム): オープンソースの加重セルフホスティングと RAG (検索拡張生成) フレームワークを組み合わせて、企業はプライベートな知識の質問応答システムを構築できます。 Apache 2.0 ライセンスにより、データが企業インフラストラクチャから流出することがなく、サードパーティの API 呼び出しによるプライバシーのリスクがなくなります。 実装のヒント: 多言語が混在するドキュメントのシナリオでは、再現品質を向上させるために、ハイブリッド検索 (キーワード + セマンティック検索) および再ランク メカニズムと連携することをお勧めします。 Hy3 自体はドキュメント レベルの RBAC を提供しないため、RAG フレームワーク層で権限の分離を実装する必要があります。

シナリオには適していません: 極端な創造性を必要とするブランドのコピーライティング (Hy3 の出力スタイルはよりエンジニアリング指向であり、創造性の豊かさは Claude シリーズほど豊かではありません)。非常に高度な英語文書スタイルを必要とする非コーディングのシナリオ (学術論文の推敲など)。マルチモーダル入力 (画像認識、ビデオ理解など) を必要とするシナリオ。

Hy3 の適用可能なグループ

  • ソフトウェア開発者およびエンジニア: Hy3 の中心的な対象者。日々のコーディング支援、バグ診断、コードレビュー、または複雑なエンジニアリングタスクのいずれであっても、SWE ベンチでの Hy3 の 78% のパフォーマンスは、Hy3 が開発者にとって信頼できるプログラミング パートナーになれることを意味します。 境界には適していません: 英語ドキュメント生成 (オープンソース プロジェクトの英語ドキュメントなど) に非常に高い品質要件があるチームの場合は、二次磨きに Grammarly などのツールを使用することをお勧めします。

  • AI エージェント開発者および自動化エンジニア: Web ページ データ収集からコマンド ライン ツール チェーン オーケストレーションまで、自動化されたワークフローを構築する必要がある開発者。Hy3 のツール コールの安定性とクロスフレームワーク汎用化機能により、Hy3 はエージェント システムの理想的なベース モデルになります。 前提条件: エージェント フレームワーク (Cline、CodeBuddy など) を設定し、適切なステップ予算と確認ポイント戦略を設定する必要があります。

  • エンタープライズ & テクノロジー チーム (プライベート展開): データ主権とコンプライアンスに重点を置いている企業。 Hy3 の Apache 2.0 ライセンスとセルフホスティング機能により、民営化された AI インフラストラクチャに最適です。 購入の前提条件: 企業は、8×H20-80G レベルの GPU クラスターを所有またはレンタルでき、対応する運用およびメンテナンス機能を備えている必要があります。セルフホスティングに切り替えるかどうかを決定する前に、API モードで ROI を確認することをお勧めします。

  • AI 研究者およびモデル開発者: オープンソースの重みと完全な微調整/RL パイプラインにより、Hy3 は研究および二次開発のための優れたベース モデルになります。 192 専門家 MoE アーキテクチャ自体にも研究価値があります。 不適合境界: 実験的な再現にはハードウェア要件が高くなります (フル重量は約 600GB ストレージ + マルチカード GPU)。

注意して使用してください: 応答遅延に非常に敏感なリアルタイム インタラクション シナリオ (オンライン カスタマー サービスからのリアルタイム応答など) では、Hy3 の約 2.65 秒の TTFT は理想的ではない可能性があります。遅延に関して特別に最適化された小規模モデルまたは蒸留バージョンを選択することをお勧めします。非常に長いドキュメント (256K の制限に近い) を処理する場合は、コンテキスト ウィンドウのオーバーフローのリスクを避けるために、ドキュメントを一度にすべて入力するのではなく、セクションに分けて送信することをお勧めします。

概要と展望

Hy3 は、中国の大規模モデルのオープンソース ルートにおける重要な転換点を表しています。Tencent は、Apache 2.0 ライセンスに基づいて、地理的制限なしで SWE ベンチのほとんどのクローズド ソース モデルを超えるオープンソース MoE モデルをリリースしました。これは、Meta LLaMA や Mistral などの西側のオープンソース ルートへの対応であるだけでなく、API 収益に依存するのではなく、オープンソースを通じて環境への影響を確立するという戦略的な選択でもあります。

現在の主な利点: 295B パラメータのうち 21B のみがアクティブ化される MoE アーキテクチャは、優れたコスト パフォーマンスをもたらします。 SWE ベンチ検証 78%、GPQA ダイヤモンド 90.4% のパフォーマンスは、オープンソース モデルの中でも第一段階にあります。 Apache 2.0 ライセンスにより、商用利用に対する法的障壁が完全に排除されます。エンジニアリングの信頼性は 50 以上の Tencent 社内製品によって検証されています。

現在の主な制限: 生態学的成熟度は DeepSeek や Qwen よりも低く、サードパーティのツール チェーン、コミュニティ チュートリアル、および中国の技術記事がまだ蓄積されています。 1M の超大規模コンテキストはまだサポートされていません。英語のノンコード シナリオは、純粋な英語のモデルほど洗練されていません。導入ハードウェアのしきい値は同じインテリジェンス密度の高いモデルよりも低いですが、8×H20-80G は依然として中小規模のチームにとって簡単に購入できるものではありません。

今後の観察ポイント:テンセントがHy3シリーズをマルチモーダル(ビジュアル、音声)分野に展開するかどうか。コミュニティが Hy3 を中心に十分に豊富な微調整バリアントと専用ツール チェーンを形成するかどうか。 Tencent が企業のアクセス プロセスを簡素化するために公式のマネージド API を開始するかどうか。次のバージョン (Hy3.5 または Hy4) が、より大きなコンテキスト ウィンドウとより高いアクティベーション パラメータ バジェットをサポートするかどうか。

調達と導入のリスク評価: 個人の開発者や起業家チームの場合、OpenRouter などのサードパーティ API を経由するたびに料金を支払うことで、リスクなしで Hy3 のコア機能を体験できます。 A/B テストのために日常のコーディング ツール チェーンに組み込むことをお勧めします。プライベート化された展開を計画している企業の場合は、本番レベルのエージェント タスクに拡張する前に、モデルの出力品質とチームの受け入れを検証するために、重要ではないプロセス (内部コード レビュー、自動テスト生成など) でトライアルを展開することをお勧めします。購入する前に、GPU モデルと導入されたハードウェアの数量が目標の負荷を満たせるかどうか (vLLM/SGLang の公式パフォーマンス データを参照)、モデル バージョンの更新の下位互換性保証 (現時点では正式なコミットメントはありません)、および Apache 2.0 ライセンスが企業の予想される使用法 (微調整されたモデルの再配布など) を完全にカバーしているかどうかを確認することが重要です。コンプライアンスに敏感な業界 (金融、医療、政府機関) では、運用に入る前に民営化環境でレッドチームのテストと監査を一通り完了することをお勧めします。

関連ツール: CrewAI、langchain

バージョン情報

  • Hy3 :正式にリリースされたバージョンは、プレビュー バージョンから 50 以上の製品フィードバックを収集した後の大規模なトレーニング後の最適化に基づいており、エージェントの機能、ツール呼び出しの安定性、対幻覚機能が大幅に向上しています。
  • Hy3 プレビュー :新しいインフラストラクチャでトレーニングされたモデルの最初のバッチであるプレビュー バージョンでは、295B MoE アーキテクチャの実現可能性が検証され、SWE ベンチで 74.4% が検証されました。
  • HY2(フーエナジー2) :第 2 世代のハイブリッド モデルである SWE ベンチは約 53.0% であり、Hy3 のアーキテクチャ アップグレードのベースラインとなります。公式の正確な日付はまだありません。

ユーザーレビュー

  • レビューを読み込み中...