Hy3 (Tencent Hunyuan 3)
Kostenlos
Hy3 (Tencent Hunyuan 3) ist das vom Tencent Hunyuan-Team eingeführte Hybrid-Expertenmodell (MoE) der dritten Generation für große Sprachen. Es verfügt über einen Gesamtparameter von 295B, einen Aktivierungsparameter von 21B, 192 Experten-Top-8-Routen, 256.000 Kontextfenster und eine Open-Source-Apache-2.0-Lizenz. Es erreicht 74,4 % bei SWE-Bench Verified und 90,4 % bei GPQA Diamond. Es verfügt über leistungsstarke Codegenerierung, Toolaufrufe und Agentenfunktionen und wurde auf über 50 interne Produkte von Tencent angewendet.
Hy3 (Tencent Hunyuan 3): Der Maßstab für Agenten- und Codefunktionen des Open-Source-MoE-Großmodells
Kernparameter und Statistiken von Hy3
Hy3 (Hunyuan 3) ist das große Sprachmodell Mixture-of-Experts (MoE) der dritten Generation, das vom Hunyuan-Team von Tencent eingeführt wurde. Es ist außerdem Tencents bislang stärkstes und offenstes Basismodell. Im Vergleich zur vorherigen Generation Hy2 hat Hy3 generationsübergreifende Verbesserungen in Bezug auf Parametergröße, Expertenskala, Kontextlänge und Argumentationsfähigkeiten erzielt. Es ist vollständig Open Source unter der Apache 2.0-Lizenz und unterliegt keinen geografischen Einschränkungen.
| Projekt | Spezifikationen |
|---|---|
| Produktname | Hy3 (Hunyuan 3 / Tencent Hunyuan dritte Generation) |
| Produkttyp | Grundlegendes großes Modell (MoE) |
| Gesamtparameter | 295B (299B einschließlich MTP-Schicht) |
| Aktivierungsparameter | 21B |
| MTP-Layer-Parameter | 3,8B |
| Anzahl Experten | 192 Experten, Top-8-Routen |
| Anzahl der Netzwerkschichten | 80 Schichten (ohne MTP) |
| Achtung Köpfe | 64 (GQA, 8 KV-Köpfe, Kopfabmessung 128) |
| Dimension der verborgenen Ebene | 4096 |
| Abmessung der Mittelschicht | 13312 |
| Kontextfenster | 256.000 Token |
| Wortschatzgröße | 120.832 |
| Stützpräzision | BF16/FP8 |
| Lizenzvereinbarung | Apache 2.0 |
| Lieferform | Open-Source-Gewicht (HuggingFace / ModelScope) + API (OpenRouter und andere Dritte) |
| Startseite | CN (Tencent) |
| Unterstützte Sprachen | Chinesisch, Englisch |
| Erscheinungsdatum | Vorschau: 23.04.2026; Vollständig: 06.07.2026 |
Hy3 ist nicht als allwissendes und allmächtiges allgemeines Modell positioniert, sondern „strebt die höchste Inferenzqualität unter einem bestimmten Parameterbudget an“. Die 21B-Aktivierungsparameter erfordern nur etwa 4,2 % des Netzwerks, um an der Berechnung teilzunehmen (8/192 Experten), wenn die Inferenz ausgeführt wird, wodurch die Bereitstellungskosten viel niedriger sind als bei dichten Modellen mit demselben Intelligenzniveau. Das 256K-Kontextfenster kann ungefähr 384 Seiten A4-Dokumente gleichzeitig verarbeiten, was für eine lange Dokumentanalyse und ein dateiübergreifendes Verständnis der Codebasis geeignet ist.
Tatsächliche Bedeutung der Effizienzverbesserung: Im Vergleich zu anderen Modellen mit 21B Aktivierungsparametern und 100B+ Aktivierungsparametern hat Hy3 einen natürlichen Vorteil beim Inferenzdurchsatz. Bei der Bereitstellung mit vLLM oder SGLang sind die Speichernutzung und die Verzögerung der Token-Generierung einer einzelnen Inferenz geringer als bei dichten Modellen mit demselben Intelligenzniveau. Bei Hochfrequenz-API-Aufrufern spiegelt sich dies direkt in niedrigeren Token-Stückpreisen und einer geringeren Latenz bei der Stapelverarbeitung wider.
Design des Argumentationsmodus: Unterstützt drei Kontrollebenen von „reasoning_effort“: „no_think“ (direkter Modus, geeignet für deterministische Aufgaben wie Übersetzung und Zusammenfassung), „niedrig“ (leichtes Denken, geeignet für normale Fragen und Antworten), „hoch“ (tiefes Kettendenken, geeignet für mathematische Beweise, Wettbewerbsprogrammierung, komplexe Agentenplanung). Wenn der Modus „Hoch“ ausgewählt ist, erhöht sich die Menge der ausgegebenen Token um das 3- bis 8-fache und die Kosten für einen einzelnen Anruf erhöhen sich entsprechend.
Benutzer und Marktbekanntheit von Hy3
Die Marktbekanntheit von Hy3 zeigt ein Zweiradantriebsmuster von „Tencents interner Produktionsüberprüfung + Ruf der Open-Source-Community“.
Interner Produktionsumfang: Hy3 wurde vor seiner offiziellen Veröffentlichung in die über 50 internen Produktlinien von Tencent integriert und deckt Kerngeschäfte wie WeChat, QQ, Tencent Cloud und Spieleplattformen ab. Dieser Grad an interner Bereitstellung bedeutet, dass das Modell anhand von echtem Datenverkehr und komplexer Geschäftslogik getestet wurde – einschließlich der Stabilität von Mehrrundendialogen, der Kontrolle der langen Kontextdämpfung, der Mischung mehrerer Sprachen und anderer technischer Herausforderungen, die in der Produktionsumgebung ausgefeilt wurden.
Antwort der Open-Source-Community: Bis Juli 2026 hat das „Tencent-Hunyuan/Hy3“-Warehouse auf GitHub mehr als 530 Sterne und mehr als 120 Forks erhalten, und die monatlichen Downloads von Modellgewichten auf HuggingFace übersteigen das 14.000-fache. Die Community rund um Hy3 hat über 10 fein abgestimmte Varianten und über 65 quantisierte Versionen produziert (unterstützt Toolketten wie llama.cpp, LM Studio, Jan usw.), und 15 HuggingFace Spaces bieten Online-Erlebniseingänge.
Bewertungsleistung durch Dritte: Auf dem Intelligence Index von Artificial Analysis belegte Hy3 mit einer Punktzahl von 41 (insgesamt 97 Modellvergleiche) den 8. Platz unter den Open-Source-Modellen mit extrem großem Parametermaßstab und lag damit deutlich über dem Kategoriemedian von 25 Punkten. Zu den wichtigsten Benchmark-Ergebnissen gehören:
- GPQA Diamond: 90,4 % (Wissensbegründung, höchste Ebene des Open-Source-Modells)
- SWE-Bench verifiziert: 78 % (tatsächliche Lösungsrate der Codierungsaufgabe)
- SWE-bench Pro: 57,9 % (komplexe Engineering-Aufgaben)
- Die letzte Prüfung der Menschheit: 53,2 % (umfassender Wissenstest)
- Deep-SWE: 28 % (unabhängige Codereparatur)
- Apex-Agenten: 25,6 % (Agentenaufgaben)
- LHTB (langfristige Terminalaufgabe): 28,8 % (langfristige Agentenaufgabe)
Blindtest-Expertenbewertung: Tencent führte gemeinsam mit 270 Branchenexperten einen Blindtest durch. Hy3 erhielt eine Gesamtpunktzahl von 2,67/4 und übertraf damit die 2,51/4 von GLM-5.1. Die größten Vorteile konzentrieren sich auf Frontend-Entwicklung, Datenspeicherung und CI/CD-Aufgaben. Dieses Ergebnis spiegelt den Modellnutzen in realen Szenarien besser wider als ein einzelner Benchmark.
Kostenvorteile von Hy3
Die Kostenstruktur von Hy3 besteht aus drei Ebenen: „Apache 2.0 Open Source, keine Lizenzgebühr + niedrige Aktivierungsparameter-Argumentationseffizienz + niedriger Preis für APIs von Drittanbietern“. Es ist derzeit eines der kostengünstigsten Open-Source-Großmodelle.
C-Client/Einzelbenutzer: Laden Sie Modellgewichte direkt über HuggingFace („tencent/Hy3“) herunter, völlig kostenlos. Einzelne Entwickler können Inferenz auf ihrer eigenen Hardware ausführen, ohne Lizenz- oder API-Gebühren zu zahlen. Allerdings müssen Sie die Kosten für die GPU-Rechenleistung selbst tragen – um Hy3-Inferenz mit voller Präzision mit 8×H20-80G oder einer gleichwertigen Konfiguration auszuführen, liegt eine einzelne Hardware-Investition in der Größenordnung von Zehntausenden bis Hunderttausenden Yuan. Für gelegentliche Nutzungsszenarien ist es wirtschaftlicher, für APIs von Drittanbietern zu bezahlen.
Entwickler-/API-Aufruf (am Beispiel von OpenRouter):
| Abrechnungspositionen | Preis (USD/Million Token) | Vergleichsreferenz |
|---|---|---|
| Eingabe (Cache-Treffer) | 0,035 $ (-75 % Rabatt) | Claude Sonnet 5: 3 $/M |
| Eingabe (Standard) | 0,14 $ | GPT-5.6: ~15 $/M. |
| Ausgabe | 0,58 $ | Grok 4,5: 6 $/M |
| Mischpreis (Verhältnis 7:2:1) | Ca. 0,11 $ | DeepSeek V4-Flash: Ca. 0,08 $ |
Der API-Preis von Hy3 beträgt etwa 1/10 bis 1/50 des Preises von Closed-Source-Modellen mit ähnlichem Intelligenzniveau. Für eine schlanke Anwendung, die 1 Million Token-Eingaben und 500.000 Token-Ausgaben pro Tag verarbeitet, betragen die monatlichen Kosten etwa (0,14 × 30 $ + 0,58 $ × 15) = 12,9 $/Monat, was nahezu vernachlässigbar ist.
Enterprise/private Bereitstellung: Das Open-Source-Gewicht ist kostenlos (Apache 2.0), aber die Infrastrukturkosten – wenn man einen 8×H20-80G-Server als Referenz nimmt, betragen die monatlichen Mietkosten für eine einzelne Einheit etwa 8.000–12.000 US-Dollar (Evian-Hersteller und Vertragslänge schwanken), was mäßig gleichzeitige Hy3-Inferenz unterstützen kann. Die Gesamtkosten des Unternehmens sollten auf der Grundlage des Modells „API-Jahresgebühr vs. private Dreijahreskosten-TCO“ bewertet werden, und die versteckten Kosten für Betriebs- und Wartungspersonal, iterative Modellversionsaktualisierungen und quantitative Bereitstellung (FP8 reduziert den Videospeicherbedarf weiter) müssen einbezogen werden.
Kauftipps: Die API-Preise basieren auf der Echtzeitseite jedes Dienstanbieters. Es gibt Preisunterschiede in verschiedenen Regionen (z. B. Festlandchina vs. Übersee). Die empfohlenen Hardwarekonfigurations- und Leistungsindikatoren für die private Bereitstellung basieren auf dem Kapitel „Bereitstellung“ des GitHub-Repositorys.
Hauptfunktionen von Hy3
Das funktionale Design von Hy3 konzentriert sich auf die vier Kernfähigkeitslinien „Codegenerierung + Aufruf von Agententools + Deep Reasoning + Langer Kontext“.
-
Code-Generierung und Engineering-Aufgaben: Behandelt Code-Generierung, Vervollständigung, Refactoring, Fehlerdiagnose und Unit-Test-Generierung für gängige Sprachen wie Python, JavaScript/TypeScript, Java und Go. Eine Lösungsrate von 78 % bei SWE-Bench Verified bedeutet, dass das Modell in der Lage ist, echte GitHub-Problembeschreibungen zu verstehen, relevante Codedateien zu finden und zusammenführbare Korrekturen vorzuschlagen. Implementierungstipps: Für komplexe Engineering-Aufgaben empfiehlt es sich, den Modus „reasoning_effort=high“ zu aktivieren. Im Straight-out-Modus kann die Randbedingungsverarbeitung fehlen.
-
Agent Tool Calling (Funktionsaufruf): Die Tool Calling-Funktion von Hy3 ist das zentrale Highlight dieses Upgrades. Das Modell unterstützt nativ mehrere Runden von Tool-Aufrufen, Fehlerbehebung und agentenübergreifender Framework-Generalisierung – die durch SWE-Bench verifizierte Genauigkeit schwankt innerhalb von 4 % unter verschiedenen Gerüsten (CodeBuddy, Cline, KiloCode). Tool-Öffnungsliste: Unterstützt Standard-Toolverhalten wie „Navigieren“ (Webseitennavigation), „Klicken“ (Klicken auf ein Element), „Typ/Eingabe“ (Texteingabe), „Screenshot“ (Seiten-Screenshot), „Extrahieren“ (Informationsextrahieren), „Warten“ (Wartebedingungen), „Datei lesen und schreiben“, „execute_command“ (Befehlsausführung), „Beenden“ (Bericht über das Ende der Aufgabe). Architekturlink: „LLM (Hy3) → API/MCP-Server → Tool-Ausführungsumgebung → Beobachtung gibt LLM zurück“, wodurch eine interaktive geschlossene Schleife von „Planung → Ausführung → Beobachtung → Anpassung“ entsteht.
-
Deep Reasoning and Thought Chain: Unterstützt anpassbare Gedankenketten. Erreichen des Spitzenniveaus von Open-Source-Modellen bei der Beantwortung von Wissensfragen (GPQA Diamond 90,4 %) und komplexen Denkaufgaben (Humanity's Last Exam 53,2 %). Interne Überprüfungen zeigen, dass die Halluzinationsrate von Hy3 von 12,5 % in der Hy3-Vorschau auf 5,4 % und die Fehlerrate des gesunden Menschenverstands von 25,4 % auf 12,7 % gesunken sind, was eine deutliche Verbesserung der sachlichen Genauigkeit und logischen Konsistenz darstellt.
-
Langes Kontextverständnis (256.000 Token): Kann etwa 384 Seiten Textinhalt gleichzeitig verarbeiten, geeignet für Szenarien wie die Überprüfung von Rechtsverträgen, die globale Analyse großer Codebasen, das Verständnis langer Konversationsverläufe usw. Durch die gemeinsame Optimierung von SFT und RL wird die Rate der referenziellen Auflösung, Auslassungswiederherstellung und Einschränkungsvererbungsprobleme in Mehrrundenkonversationen von 17,4 % auf 7,9 % reduziert. Implementierungstipps: Die Inferenzlatenz und der KV-Cache-Overhead nehmen in Szenarios mit langem Kontext erheblich zu. Es wird empfohlen, bei Aufgaben, die wirklich eine kapitelübergreifende Korrelation erfordern, den vollständigen Kontext zu aktivieren und die täglichen Aufgaben innerhalb von 32 KB zu steuern, um die Kosten auszugleichen.
-
Multimodale Erweiterung: Der Kern von Hy3 ist ein Textmodell, es kann jedoch über die visuelle Sprachmodellpipeline von Tencent auf das Bild- und Textverständnis erweitert werden. Der native Hy3-gewichtete visuelle Modus wird nicht unterstützt und reine Textszenen müssen diese Einschränkung nicht beachten.
-
Toolkette zur technischen Optimierung: Bietet eine vollständige Feinabstimmungspipeline (Finetune) (basierend auf vLLM/SGLang), RL-Post-Training (GRPO über verl + Megatron-LM + vLLM-Rollout) und Quantisierungstools (AngelSlim unterstützt gängige Quantisierungsalgorithmen, Low-Bit-Quantisierung und spekulatives Sampling). Entwickler können vertikale domänenspezifische Modelle basierend auf Hy3-Gewichten erstellen.
Hy3-Modell- und Versionsentwicklung
Die Versionsiteration von Hy3 folgt dem Rhythmus „Vorschauüberprüfung → Feedback-Sammlung → Vollständige Release-Optimierung“.
Mainline-Veröffentlichung
- Hy2 (~2025-12): Hunyuan-Modell der zweiten Generation, SWE-Bench liegt bei etwa 53,0 %, was eine Basis für das MoE-Architektur-Upgrade von Hy3 bildet. Einen offiziellen genauen Veröffentlichungstermin gibt es noch nicht.
- Hy3-Vorschau (23.04.2026): Die erste Reihe von Trainingsmodellen für die neue Infrastruktur, die zum ersten Mal die 295B MoE-Architektur (21B Aktivierung) und 192 Experten-Top-8-Routing verwenden. SWE-bench Verified erreichte 74,4 %, was die Aufmerksamkeit der Entwickler-Community auf sich zog. Nach der Veröffentlichung sammelte Tencent mehr als 50 interne Rückmeldungen zur Produktnutzung.
- Hy3 Full (06.07.2026): Umfassende Optimierung nach dem Training basierend auf Vorschau-Feedback. Zu den wichtigsten Verbesserungen gehören:
- Die Stabilität des Tool-Aufrufs und die Fehlerbeseitigungsfunktionen wurden erheblich verbessert
- Die Illusionsrate wurde von 12,5 % auf 5,4 % reduziert, die Fehlerrate des gesunden Menschenverstands wurde von 25,4 % auf 12,7 % reduziert.
- Die Problemrate bei der Verfolgung von Gesprächsabsichten in mehreren Runden wurde von 17,4 % auf 7,9 % gesenkt.
- Die Ausgabe ist präziser und verhindert gleichzeitig, dass komplexe Absichten bei Interaktionen über große Entfernungen verfallen
- Gleichzeitige Veröffentlichung der quantitativen Version des FP8 (Hy3-FP8), um die Bereitstellungsschwelle zu senken
Kandidatenverifizierung
- Hy3-FP8 (veröffentlicht am selben Tag wie Full): Eine quantisierte Version von FP8, die mit der AngelSlim-Toolkette arbeitet, was den Grafikspeicherbedarf erheblich reduziert und gleichzeitig die Qualität der Inferenz beibehält, sodass mehr Entwickler Hy3 auf begrenzter Hardware ausführen können.
Versionshinweise: Die Open-Source-Richtlinie von Hy3 wird unter der Apache 2.0-Lizenz veröffentlicht, ohne zusätzliche Bedingungen und ohne geografische Einschränkungen. Die Gewichte der alten Version (Hy2) wurden auch über die Organisationsseite Tencent HuggingFace veröffentlicht. Nachfolgende Versionsiterationspläne unterliegen den Informationen, die vom GitHub-Warehouse und dem offiziellen Twitter/X-Konto veröffentlicht werden.
Technische Vorteile von Hy3
Die technische Routenauswahl von Hy3 spiegelt Tencents Ingenieurskompetenz bei der „Maximierung der Argumentationsqualität bei begrenztem Rechenleistungsbudget“ wider.
MoE-Architektur und 192 Experten-Top-8-Routing: Das MoE von Hy3 erhöht nicht einfach die Anzahl der Experten, sondern stellt 192 Experten-Subnetzwerke pro Schicht im 80-Schichten-Transformer bereit, von denen nur 8 pro Token aktiviert werden (ca. 4,2 % Aktivierungsrate). Dies bedeutet, dass nur 21B der 295B Parameter an jedem Schritt der Argumentation beteiligt sind, wodurch umfangreiches Wissen gespeichert und gleichzeitig die Menge der Argumentationsberechnungen gesteuert wird. Unterschiedliche Token werden an unterschiedliche Experten weitergeleitet – Code-Token aktivieren in der Regel Experten für Code-Expertise, und Token für natürliche Sprache aktivieren Experten für Sprach-Expertise und bilden so eine implizite Aufgabenpartition.
MTP-Schicht (Multi-Task-Vorhersageschicht): Die gemeinsame MTP-Schicht mit 3,8 Milliarden Parametern koordiniert die Ausgabe verschiedener Experten und stellt sicher, dass die Gesamtsequenz semantische Kohärenz beibehält, selbst wenn unterschiedliche Token von unterschiedlichen Experten verarbeitet werden. Dies ist der Schlüsselmechanismus für Hy3, um bei komplexen mehrstufigen Überlegungen eine stabile Ausgabe aufrechtzuerhalten.
Reasoning Effort: Das Modell kann über den Parameter „reasoning_effort“ dynamisch zwischen „Geschwindigkeit“ und „Tiefe“ angepasst werden. Im „no_think“-Modus erzeugt das Modell direkt Antworten, was für verzögerungsempfindliche Szenarien geeignet ist; Im „Hoch“-Modus entwickelt das Modell eine vollständige Argumentationskette. Dieses Design ermöglicht die adaptive Anpassung derselben Modellgewichte an unterschiedliche Verzögerungsbudgets, ohne dass mehrere Versionen bereitgestellt werden müssen.
Post-Training-Pipeline (SFT + RL): Die SFT- und GRPO-Reinforcement-Learning-Pipeline von Hy3 läuft auf dem verl + Megatron-LM-Framework und unterstützt verteiltes Training in großem Maßstab. Die Verbesserung der Datenqualität und -vielfalt nach dem Training ist der Hauptgrund für den Qualitätssprung von der Hy3-Vorschau zur Vollversion. Die interne Auswertung zeigt, dass der gemeinsame Optimierungseffekt auf die Halluzinationsrate, Fehler im gesunden Menschenverstand und die Mehrrundenkonsistenz signifikant ist.
Stabilität von Werkzeugaufrufen auf Produktionsniveau: Hy3 behebt mehrere grundlegende Zuverlässigkeitsprobleme, um Werkzeugaufrufe unter verschiedenen Konfigurationen und Ausgabebeschränkungen auf Produktionsstandards zu bringen. Die Varianz der SWE-Bench-verifizierten Genauigkeit des Modells auf verschiedenen Agent-Frameworks (CodeBuddy, Cline, KiloCode) bleibt innerhalb von 4 %, was darauf hinweist, dass die Tool-Aufruffunktion nicht an eine bestimmte Framework-Implementierung gebunden ist.
Engineering Deployment Adaptation: Hy3 verfügt über offizielle Anpassungslösungen für die beiden Mainstream-Inferenz-Engines vLLM und SGLang, die die Beschleunigung der spekulativen Decodierung von MTP unterstützen. Es wird empfohlen, während der Bereitstellung eine Speicher-GPU mit 8×H20-80G oder mehr zu verwenden. Die quantisierte FP8-Version kann den Speicherbedarf weiter reduzieren. Das Quantifizierungstool AngelSlim ist Open Source von Tencent und unterstützt gängige Quantisierungsalgorithmen und Low-Bit-Quantisierung.
Leistungs- und Durchsatzreferenz: Laut tatsächlicher Messung durch Artificial Analysis beträgt die mittlere Ausgabegeschwindigkeit von Hy3 auf der Drittanbieter-API etwa 60,3 Token/s (niedriger als der Kategoriemedian von 64,2, aber die Lücke ist nicht groß), und die mittlere TTFT (Verzögerung des ersten Wortes) beträgt etwa 2,65 Sekunden (etwas höher als der Kategoriemedian von 1,83 Sekunden). Die spezifischen Werte variieren je nach Bereitstellungshardware, Quantifizierungsmethode und Parallelität und unterliegen tatsächlichen Tests.
Adaptionsgrenzen und Szenenbeschränkungen von Hy3
Best in: Codegenerierung und Agentenaufgaben, mathematisches Denken und Wissensfragen und -antworten, zweisprachige Verarbeitung in Chinesisch/Englisch, Toolaufruf und mehrstufige Planung.
Nicht gut: Die Feinheit des englischen Dokumentstils ist etwas geringer als die von rein englischen Trainingsmodellen; die Vertrautheit mit westlichen Long-Tail-Frameworks und -Tools ist nicht so gut wie die mit ökologisch ausgereifteren Modellen wie DeepSeek; die visuelle Modalität wird nicht unterstützt (reines Textmodell); Die Argumentationsverzögerung nimmt im Szenario mit extrem langen Kontexten (nahe der 256-KB-Grenze) erheblich zu.
Vergleich mit Konkurrenzprodukten:
| Vergleich | Hy3 | DeepSeek V4 Pro | GLM-5.2 | Claude Sonett 5 |
|---|---|---|---|---|
| Gesamtparameter | 295B | 1,6T | Über 744B | Nicht bekannt gegeben |
| Aktivierungsparameter | 21B | Ungefähr 49B | Ungefähr 100 Mrd.+ | Nicht bekannt gegeben |
| Kontext | 256K | 1M | ~256K | ~200K |
| Lizenz | Apache 2.0 | MIT | MIT | Geschlossene Quelle |
| API-Eingabepreis | 0,14 $/Mio. | ¥1-3/M | 0,5–1 $/M | 3 $/M. |
| SWE-Bank | 78 % | etwa 75 % | ca. 62 % | etwa 70 % |
Der Hauptvorteil von Hy3 besteht darin, mit den kleinsten Aktivierungsparametern und der vollständig offenen Lizenz von Apache 2.0 die stärkste SWE-Bench-Leistung zu erzielen. Der Nachteil besteht darin, dass die ökologische Reife nicht so gut ist wie bei DeepSeek und die 1M-Ultra-Large-Context-Szene noch nicht abgedeckt wurde.
So verwenden Sie Hy3
Hy3 bietet zwei Nutzungsmodi: „Open-Source-Selbsthosting + Drittanbieter-API“, die alle Szenarien abdecken, von persönlichen Experimenten bis hin zur Bereitstellung auf Unternehmensebene.
| So verwenden Sie | Geeignet für Menschen | Funktionen | Kosten |
|---|---|---|---|
| Drittanbieter-API (OpenRouter usw.) | Entwickler, kleine Teams | Sofort einsatzbereit, keine GPU erforderlich | Pay-as-you-go (0,14 $/0,58 $ pro M-Token) |
| Selbsthosting (vLLM) | Unternehmen, technisches Team | Daten verlassen die Domäne nicht, volle Kontrolle | GPU-Rechenkosten |
| Selbstgehostet (SGLang) | Unternehmen, technisches Team | Offizielle Adaption, MTP-Beschleunigung | Kosten für GPU-Rechenleistung |
| UmarmenGesichtsgewicht herunterladen | Forscher, Modellentwickler | Feinabstimmung/Quantifizierung/Sekundärentwicklung | Kostenlos (Sie müssen Ihre eigene Hardware mitbringen) |
API-Schnellstart (OpenRouter kompatibel mit OpenAI SDK):
„Python von openai importieren OpenAI
client = OpenAI(
base_url="https://openrouter.ai/api/v1",
api_key="
Antwort = client.chat.completions.create( model="tencent/hy3", Nachrichten=[ {"role": "user", "content": "Verwenden Sie Python, um eine zwischengespeicherte Fibonacci-Sequenzberechnung zu implementieren."} ], Temperatur=0,9, top_p=1,0, extra_body={ „chat_template_kwargs“: {“reasoning_effort“: „high“} } ) print(response.choices[0].message.content) „
Beschreibung der wichtigsten Parameter: „temperature“ wird mit 0,9 empfohlen, „top_p“ mit 1,0; „reasoning_effort“ ist optional „no_think“ (direkt), „low“ (leichtes Denken), „high“ (tiefes Denken). Es wird empfohlen, den „Hoch“-Modus für Code- und komplexe Argumentationsszenarien zu verwenden.
Selbstgehostet – vLLM-Bereitstellung (8 GPU empfohlen):
„Bash
vLLM muss zuerst kompiliert und installiert werden (basierend auf dem Quellcode)
export VLLM_FLASHINFER_ALLREDUCE_BACKEND=trtllm vllm dienen Tencent/Hy3 \ --tensor-parallel-size 8 \ --speculative-config.method mtp \ --speculative-config.num_speculative_tokens 2 \ --tool-call-parser hy_v3 \ --reasoning-parser hy_v3 \ --enable-auto-tool-choice \ --port 8000 \ --served-Modellname hy3 „
Selbstgehostet – SGLang-Bereitstellung:
„Bash python3 -m sglang.launch_server \ --model tencent/Hy3 \ --tp-size 8 \ --tool-call-parser hunyuan \ --reasoning-parser hunyuan \ --speculative-num-steps 2 \ --speculative-eagle-topk 1 \ --speculative-num-draft-tokens 3 \ --speculative-algorithm EAGLE \ --port 8000 \ --served-Modellname hy3 „
Nach Abschluss der Bereitstellung können lokale Dienste über die OpenAI-kompatible Schnittstelle aufgerufen werden. Detaillierte Bereitstellungsdokumente finden Sie in der README-Datei des GitHub-Repositorys „Tencent-Hunyuan/Hy3“.
Produktpreise für Hy3
Die Preisgestaltung von Hy3 setzt das „Open-Source-gewichtsfreie + Drittanbieter-API-Pay-as-you-go“-Modell fort.
Open-Source-Gewicht: Apache 2.0-Lizenz, keine Nutzungsbeschränkungen, keine geografischen Beschränkungen, keine kommerziellen Nutzungsbeschränkungen. Es steht Benutzern frei, es herunterzuladen, zu verwenden, zu ändern und weiterzuverbreiten. Im Gegensatz zur Llama-Community-Lizenz von Meta ist für Hy3 kein zusätzlicher Antrag auf eine kommerzielle Lizenz erforderlich.
Preise für APIs von Drittanbietern: Geben Sie basierend auf dem Durchschnittspreis auf OpenRouter 0,14 $/Million Token ein und geben Sie 0,58 $/Million Token aus. 75 % Rabatt auf Cache-Treffer (0,035 $/Million Token). Die Preise verschiedener Dienstanbieter (wie Fireworks AI, Together AI usw.) können geringfügig abweichen und unterliegen der Echtzeitseite der jeweiligen Plattform.
Private Bereitstellungskosten: Die Gewichte sind kostenlos, aber die Infrastrukturkosten müssen von Ihnen selbst getragen werden. Es wird empfohlen, 8×H20-80G oder eine gleichwertige GPU zu konfigurieren, und die monatlichen Mietkosten für eine einzelne Einheit betragen etwa 8.000–12.000 US-Dollar. Die quantitative FP8-Version (Hy3-FP8) kann eine höhere Parallelität auf derselben Hardware ermöglichen oder den Hardware-Schwellenwert auf eine einzelne Karte A100-80G senken (nur experimentelle Szenarien).
Enterprise Volume Purchase: Tencent hat keine offiziellen Hosting-API-Preise für Hy3 bekannt gegeben. Bei großen Verkehrsszenarien wird empfohlen, das Tencent-Team über „[email protected]“ zu kontaktieren, um Geschäftslösungen zu erhalten, oder Rabatte auf der Grundlage von Verträgen auf Unternehmensebene auf Plattformen wie OpenRouter auszuhandeln.
Hy3-Anwendungsszenarien
Die Anwendungsszenarien von Hy3 umfassen vier Dimensionen: Softwareentwicklung, Agentenautomatisierung, wissensintensive Analyse und Verbesserung der Unternehmensproduktivität.
-
Softwareentwicklung (Codegenerierung und Engineering-Aufgaben): Dies ist das stärkste Szenario für Hy3. Deckt Codevervollständigung, Fehlerlokalisierung und -reparatur, Generierung von Komponententests, Codeüberprüfung, Refactoring-Vorschläge, Verfassen technischer Dokumente usw. ab. Eine im SWE-Benchmark verifizierte Leistung von 78 % bedeutet, dass Hy3 in der Lage ist, komplexe GitHub-Problembeschreibungen zu verstehen und zusammenführbaren Fixcode zu generieren. Implementierungstipps: Es wird empfohlen, es in Verbindung mit Agent-Frameworks wie CodeBuddy, Cline oder KiloCode zu verwenden, um die Funktionen zum Aufrufen von Tools voll auszuschöpfen. Aktivieren Sie den Modus „reasoning_effort=high“ für komplexe technische Aufgaben.
-
KI-Agent und automatisierter Workflow: Die Tool Call-Stabilität von Hy3 wurde durch mehr als 50 interne Tencent-Produkte überprüft. Geeignet für die Webseitenautomatisierung (Informationserfassung, Formularausfüllung), Befehlszeilen-Toolkettenanordnung, mehrstufige Datenverarbeitungspipeline und andere Szenarien. Architektur-Link: „LLM(Hy3) → Tool-Parser → Funktionsausführung → Beobachtung → LLM-Neuplanung“. Leitfaden zu technischen Fallstricken:
- Endlosschleife und Token-Inflationskontrolle: Begrenzen Sie die maximale Anzahl von Ausführungsrunden durch den Parameter „max_steps“ (10–20 wird empfohlen) und legen Sie ein Einzelschritt-Timeout in Verbindung mit der Erkennung wiederholter Aktionen fest (beenden Sie, wenn die gleiche Beobachtung für 3 aufeinanderfolgende Schritte zurückgegeben wird), um zu verhindern, dass das Modell im Leerlauf läuft.
- DOM-/Kontextüberlastung: Für Webseiten-Agent-Aufgaben wird empfohlen, die Screenshot-Übermittlung zu deaktivieren und nur den Barrierefreiheitsbaum oder die DOM-Zusammenfassung zurückzugeben, um zu verhindern, dass das gesamte HTML-Dokument das Kontextfenster füllt.
- Sicherheit und Ultra-Authority Governance: Legen Sie einen Bestätigungspunkt (Human-in-the-Loop) für irreversible Vorgänge fest (Dateien löschen, Nachrichten senden, bezahlen und veröffentlichen) oder starten Sie im schreibgeschützten Modus in der Ausführungsumgebung, um Fehloperationen des Modells zu verhindern.
-
Wissensbefragung und Dokumentenanalyse: Die Leistung von GPQA Diamond von 90,4 % zeigt, dass Hy3 bei wissensintensiven Aufgaben den neuesten Closed-Source-Modellen nahe kommt. Durch den 256K-Kontext eignet es sich für Szenarien wie die Überprüfung langer wissenschaftlicher Arbeiten, den Vergleich rechtlicher Vertragsbedingungen und die Zusammenfassung technischer Whitepapers. Implementierungstipps: Verwenden Sie in Dokumentanalyseszenarien einfach den Modus „reasoning_effort=no_think“ oder „low“. Es ist nicht erforderlich, Deep Reasoning zu aktivieren, was zur Reduzierung der Latenz und des Tokenverbrauchs beiträgt.
-
Unternehmensproduktivität (interne Tools und RAG-Systeme): Durch die Kombination von Open-Source-gewichtetem Selbsthosting und dem RAG-Framework (Retrieval Augmented Generation) können Unternehmen private Systeme zur Beantwortung von Wissensfragen aufbauen. Durch die Apache 2.0-Lizenzierung wird sichergestellt, dass Daten die Unternehmensinfrastruktur nicht verlassen und keine Datenschutzrisiken durch API-Aufrufe Dritter entstehen. Implementierungstipps: Für mehrsprachige gemischte Dokumentszenarien wird empfohlen, mit der Hybridsuche (Schlüsselwort + semantischer Abruf) und dem Rerank-Mechanismus zusammenzuarbeiten, um die Abrufqualität zu verbessern. Hy3 selbst bietet kein RBAC auf Dokumentebene und die Berechtigungsisolierung muss auf der RAG-Framework-Ebene implementiert werden.
Nicht für Szenarien geeignet: Markentexte, die extreme Kreativität erfordern (der Ausgabestil von Hy3 ist eher technikorientiert und der kreative Reichtum ist nicht so reichhaltig wie bei der Claude-Serie); Nicht-Codierungsszenarien, die einen extrem hohen englischen Dokumentstil erfordern (z. B. das Polieren wissenschaftlicher Arbeiten); Szenarien, die multimodale Eingaben erfordern (z. B. Bilderkennung, Videoverständnis).
Anwendbare Gruppen von Hy3
-
Softwareentwickler und -ingenieure: Die Kernzielgruppe von Hy3. Ganz gleich, ob es sich um tägliche Codierungsunterstützung, Fehlerdiagnose, Codeüberprüfung oder komplexe Engineering-Aufgaben handelt, Hy3s 78 % Leistung im SWE-Benchmark bedeutet, dass es ein zuverlässiger Programmierpartner für Entwickler werden kann. Nicht für Grenzen geeignet: Für Teams, die extrem hohe Qualitätsanforderungen an die Generierung englischer Dokumente haben (z. B. englische Dokumente für Open-Source-Projekte), wird empfohlen, Tools wie Grammarly zum sekundären Polieren zu verwenden.
-
KI-Agent-Entwickler und Automatisierungsingenieure: Entwickler, die automatisierte Arbeitsabläufe erstellen müssen – von der Webseiten-Datenerfassung bis zur Orchestrierung der Befehlszeilen-Toolkette – die Tool-Call-Stabilität und die Framework-übergreifenden Generalisierungsfunktionen von Hy3 machen es zu einem idealen Basismodell für Agentensysteme. Voraussetzungen: Sie müssen das Agent-Framework (z. B. Cline, CodeBuddy) konfigurieren und ein angemessenes Schrittbudget und eine Bestätigungspunktstrategie festlegen.
-
Unternehmens- und Technologieteam (private Bereitstellung): Unternehmen, die sich auf Datensouveränität und Compliance konzentrieren. Die Apache 2.0-Lizenzierung und die Selbsthosting-Funktionen von Hy3 machen es ideal für privatisierte KI-Infrastrukturen. Kaufvoraussetzungen: Unternehmen müssen einen GPU-Cluster der Stufe 8×H20-80G haben oder mieten können und über entsprechende Betriebs- und Wartungskapazitäten verfügen. Es wird empfohlen, den ROI im API-Modus zu überprüfen, bevor Sie entscheiden, ob Sie auf Selbsthosting umsteigen.
-
KI-Forscher und Modellentwickler: Open-Source-Gewichte und eine vollständige Feinabstimmung/RL-Pipeline machen Hy3 zu einem hervorragenden Basismodell für Forschung und Sekundärentwicklung. 192 Experten Auch die MoE-Architektur selbst hat Forschungswert. Ungeeignete Grenze: Die Hardwareanforderungen für die experimentelle Reproduktion sind hoch (das volle Gewicht beträgt etwa 600 GB Speicher + Multi-Card-GPU).
Mit Vorsicht verwenden: In Echtzeit-Interaktionsszenarien, die äußerst empfindlich auf Antwortverzögerungen reagieren (z. B. Echtzeit-Antworten vom Online-Kundendienst), ist die TTFT von Hy3 von etwa 2,65 Sekunden möglicherweise nicht ideal. Es wird empfohlen, ein kleines Modell oder eine destillierte Version zu wählen, die speziell für die Verzögerung optimiert wurde. Für die Verarbeitung extrem langer Dokumente (nahe der 256-KB-Grenze) wird empfohlen, sie in Abschnitten einzureichen, anstatt sie alle auf einmal einzugeben, um das Risiko eines Überlaufs des Kontextfensters zu vermeiden.
Zusammenfassung und Ausblick
Hy3 stellt einen wichtigen Wendepunkt in Chinas Open-Source-Route für große Modelle dar – Tencent hat ein Open-Source-MoE-Modell unter der Apache 2.0-Lizenz veröffentlicht, das die meisten Closed-Source-Modelle auf der SWE-Benchmark ohne geografische Einschränkungen übertrifft. Dies ist nicht nur eine Reaktion auf westliche Open-Source-Routen wie Meta LLaMA und Mistral, sondern auch eine strategische Entscheidung: ökologischen Einfluss durch Open Source zu etablieren, anstatt sich auf API-Einnahmen zu verlassen.
Aktuelle Kernvorteile: Die MoE-Architektur mit nur 21B aktivierten von 295B Parametern bietet ein hervorragendes Preis-Leistungs-Verhältnis; Die Leistung von SWE-bench Verified 78 % und GPQA Diamond 90,4 % liegt in der ersten Reihe unter den Open-Source-Modellen; Mit der Apache 2.0-Lizenz werden rechtliche Hindernisse für die kommerzielle Nutzung vollständig beseitigt. Technische Zuverlässigkeit, bestätigt durch mehr als 50 Tencent-interne Produkte.
Hauptaktuelle Einschränkungen: Der ökologische Reifegrad ist geringer als bei DeepSeek und Qwen – es werden immer noch Toolketten von Drittanbietern, Community-Tutorials und chinesische technische Artikel angesammelt; 1M ultragroßer Kontext wird noch nicht unterstützt; Englische Nicht-Code-Szenarien sind nicht so ausgefeilt wie rein englische Modelle; Obwohl der Hardware-Schwellenwert für die Bereitstellung niedriger ist als beim Modell mit derselben Intelligenzdichte, ist 8×H20-80G für kleine und mittlere Teams immer noch nicht ohne weiteres erschwinglich.
Folgebeobachtungspunkte: Ob Tencent die Hy3-Serie auf multimodale (visuelle, sprachliche) Bereiche erweitern wird; ob die Community eine ausreichend reichhaltige Feinabstimmungsvariante und eine dedizierte Toolkette rund um Hy3 bilden wird; ob Tencent eine offiziell verwaltete API einführen wird, um den Unternehmenszugriffsprozess zu vereinfachen; ob die nächste Version (Hy3.5 oder Hy4) ein größeres Kontextfenster und ein höheres Aktivierungsparameterbudget unterstützt.
Bewertung des Beschaffungs- und Einführungsrisikos: Für einzelne Entwickler und Unternehmerteams können Sie die Kernfunktionen von Hy3 ohne Risiko erleben, indem Sie bei der Nutzung über APIs von Drittanbietern wie OpenRouter bezahlen. Es wird empfohlen, es für A/B-Tests in Ihre tägliche Codierungstoolkette zu integrieren. Für Unternehmen, die eine privatisierte Bereitstellung planen, wird empfohlen, Tests in unkritischen Prozessen (z. B. interne Codeüberprüfung, automatisierte Testgenerierung) bereitzustellen, um die Qualität der Modellausgabe und die Teamakzeptanz zu überprüfen, bevor sie auf Agentenaufgaben auf Produktionsebene ausgeweitet werden. Vor dem Kauf ist es wichtig zu bestätigen: ob das GPU-Modell und die Menge der bereitgestellten Hardware die Ziellast erfüllen können (siehe die offiziellen Leistungsdaten von vLLM/SGLang), die Abwärtskompatibilitätsgarantie für Modellversionsaktualisierungen (derzeit gibt es keine offizielle Verpflichtung) und ob die Apache 2.0-Lizenz die erwartete Nutzung des Unternehmens vollständig abdeckt (z. B. eine fein abgestimmte Modellumverteilung). In Compliance-sensiblen Branchen (Finanzwesen, Gesundheitswesen, Regierungsangelegenheiten) wird empfohlen, vor der Produktionsaufnahme eine vollständige Runde von Red-Team-Tests und Audits in einer privatisierten Umgebung durchzuführen.
Verwandte Tools: CrewAI, langchain
Versionsinfo
- Hy3 :Die offiziell veröffentlichte Version basiert auf einer umfassenden Optimierung nach dem Training, nachdem mehr als 50 Produktrückmeldungen zur Vorschauversion gesammelt wurden, was die Agentenfähigkeiten, die Tool-Aufrufstabilität und die Anti-Halluzinations-Fähigkeiten erheblich verbessert.
- Hy3-Vorschau :Die Vorschauversion, die erste Charge von Modellen, die auf der neuen Infrastruktur trainiert wurden, bestätigt die Machbarkeit der 295B MoE-Architektur, SWE-Bench-Verifizierung 74,4 %.
- HY2 (hu Energie 2) :Das Hybridmodell der zweiten Generation, SWE-Bench, liegt bei etwa 53,0 % und bietet eine Basis für das Architektur-Upgrade von Hy3. Einen offiziellen genauen Termin gibt es noch nicht.
Benutzerbewertungen