simpleHTML bench · porównywarka
Pojedynek modeli
Wybierz dwa warianty i przeglądaj wyniki slajd po slajdzie. Mapa, ranking i tabela obejmują też pozostałe wybrane modele.
Modele na mapie, w rankingu i tabeli
Poziomy rozumowania i drogi dostępu
← → slajdy · R powtórz animację · Esc wyjście
Dane szczegółowePrzewijaj poziomo, aby zobaczyć kolejne warianty →
Prompt, parametry i recenzja Luny
Rozwiń
Prompt:
—
Gotowe zestawy porównań
Zadanie po zadaniu
Szczegółowe dane i różnice oceny · tokeny · koszt · infrastruktura
| Parametr Metryki | Model A | Model B |
|---|
Ranking modeli · oceny GPT-6 Luna
Codex CLI · reasoning max
| RANK | Model / Dostawca | Reasoning | Ocena Luny | 01 | 02 | 03 | 04 | 05 | 06 | 07 | 08 | 09 | 10 | 11 | Koszt łączny |
|---|
Punkty za dolara
punkty ÷ koszt na test
| # | Model & Dostawca | Reasoning | Ocena Luny | Koszt łączny | Punkty / $1 na test | Ocenione | Łączny czas | Wartość (skala) |
|---|
Telemetria wszystkich wyników
surowe dane z runnerów
| # | Model & Dostawca | Reasoning Effort | Zadanie / Prompt | Prędkość (TPS) | Czas | Kod (LOC) | Tokeny (In/Out/Reason) | Koszt | Akcje |
|---|
Koszt, czas generacji i tokeny wyjściowe
—
Grupuj
Miara
Koszt
tańsze wyżejWedług cennika API. Przy trasach z subskrypcji (Claude Code, Codex, OpenCode Go) to ekwiwalent, a nie realny wydatek.
Czas generacji
szybsze wyżejCzas od wysłania promptu do pełnej odpowiedzi (z reasoningiem).
Tokeny wyjściowe
najwięcej wyżejTokeny odpowiedzi; bez tokenów reasoningu, które są w tabeli niżej.
Tabela porównawcza
klik w nagłówek sortuje