Polszczyzna sześciu modeli AI na opisie produktu

Daliśmy sześciu modelom ten sam brief na opis produktu do sklepu. Ortografia i interpunkcja bez zarzutu u wszystkich, różnice wyszły w stylu i w tym, jak model trzyma się briefu.

O co chodzi

Opis produktu do sklepu to jedno z najczęstszych zadań, które działy marketingu oddają dziś modelom. Sprawdziliśmy, jak sześć popularnych modeli radzi sobie z nim po polsku, gdy dostają identyczny brief z twardymi wymaganiami.

Brief

Produkt wymyśliliśmy na potrzeby testu, nie istnieje. Każdy model dostał ten sam tekst, jako jedną wiadomość, bez dodatkowych instrukcji.

Napisz opis produktu do sklepu internetowego.

Produkt: kubek termiczny „Szron”, 350 ml.
Fakty (używaj tylko tych, niczego nie dopisuj):
- stal nierdzewna, podwójna ścianka próżniowa
- napój zostaje gorący do 6 godzin, zimny do 12 godzin
- zakrętka z blokadą: kubek nie przecieka w plecaku ani w torbie
- mieści się w typowym uchwycie na kubek w samochodzie
- korpus można myć w zmywarce, pokrywkę myjemy ręcznie
- waga 280 g
- 4 kolory: grafit, mech, piasek, malina
- cena 119 zł

Dla kogo: osoby, które dojeżdżają do pracy samochodem, rowerem albo pociągiem, 25 do 45 lat.
Ton: rzeczowy i życzliwy, bez reklamowego zadęcia. Zwracaj się do czytelnika na „ty”.
Długość: od 80 do 120 słów.
Nie używaj słów: innowacyjny, rewolucyjny, idealny, wyjątkowy, najwyższej jakości, must-have. Nie używaj wykrzykników.
Obowiązkowo wspomnij o blokadzie zakrętki i o tym, że pokrywkę myje się ręcznie.
Forma: sam tekst opisu, bez tytułu, bez list wypunktowanych, bez emoji.

Metoda

Test zrobiliśmy 3 października 2026 r. przez OpenRouter, na domyślnych ustawieniach każdego modelu (bez zmiany temperatury i rozumowania). Każdy model napisał dwa teksty, razem 12.

Modele w teście (identyfikatory z odpowiedzi API)
Model Identyfikator Dostawca
Claude Sonnet 5.5 anthropic/claude-sonnet-5.5 Claude Platform on AWS
GPT-6.1 Sol openai/gpt-6.1-sol OpenAI
Gemini 3.1 Pro Preview google/gemini-3.1-pro-preview Google
Mistral Medium 3.5 mistralai/mistral-medium-3-5 Mistral
Qwen3.8 Max (0902) qwen/qwen3.8-max-0902 Alibaba
DeepSeek V4.1 Flash deepseek/deepseek-v4.1-flash AtlasCloud, DeepInfra

Gemini zamówiliśmy przez alias „gemini-pro-latest”, który tego dnia wskazywał na wersję 3.1 Pro Preview.

Każdy tekst przeszedł przez cztery sprawdzenia:

  1. Liczby: długość w słowach, zakazane słowa i wykrzykniki, liczby spoza briefu, pominięte fakty z briefu, forma „ty”.
  2. Poprawność: publiczne API LanguageTool dla języka polskiego (ortografia, interpunkcja, gramatyka).
  3. Redakcja: w każdym tekście zaznaczyliśmy kalki, sztywne konstrukcje, błędy sensu i miejsca, w których brief przeciekł do tekstu. Adnotacje przygotował model, a my je przejrzeliśmy przed odczytaniem ocen sędziów.
  4. Ślepa ocena: dwa modele spoza testowanych rodzin (Grok 4.7 od xAI i Kimi K3 od Moonshot) oceniały każdy tekst osobno, bez nazwy modelu, w skali 1 do 5: naturalność, zgodność z briefem, konkretność.

Do tego mierzyliśmy czas odpowiedzi i koszt każdego wywołania podany przez OpenRouter.

Wyniki

Wszystkie 12 tekstów zmieściło się w limicie 80 do 120 słów. Żaden nie użył zakazanego słowa ani wykrzyknika, żaden nie dopisał liczby spoza briefu. LanguageTool nie zgłosił ani jednej uwagi. Różnice zaczynają się dopiero przy stylu i przy tym, jak model czyta brief.

Wyniki, średnia z dwóch tekstów na model (oceny sędziów 1 do 5)
Model Średnia sędziów Naturalność Uwagi redakcyjne Pominięte fakty Forma „ty” Czas [s] USD za 2 teksty
GPT-6.1 Sol 4,50 4,00 1 0 2 z 2 6,0 0,008
Claude Sonnet 5.5 4,25 3,50 3 0 2 z 2 9,9 0,031
Gemini 3.1 Pro Preview 4,25 3,25 5 0 2 z 2 35,2 0,138
Qwen3.8 Max (0902) 4,08 3,50 2 0 1 z 2 100,2 0,052
Mistral Medium 3.5 3,67 3,25 5 3 2 z 2 2,1 0,004
DeepSeek V4.1 Flash 3,58 2,75 4 0 1 z 2 14,3 0,002

Średnia sędziów to średnia z naturalności, zgodności z briefem i konkretności. Sędziowie różnili się średnio o 0,67 punktu na kryterium; Grok oceniał surowiej niż Kimi.

Qwen i Gemini przy pierwszym podejściu, z limitem 4000 tokenów odpowiedzi, zużyły limit na rozumowanie. Qwen dwa razy oddał pustą odpowiedź, Gemini raz urwał tekst w połowie słowa. Powtórzyliśmy te trzy wywołania z limitem 16 000 tokenów. Nieudane próby kosztowały razem 0,098 USD i nie ma ich w tabeli.

Cytaty

Fragment najwyżej ocenionego tekstu (GPT-6.1 Sol, druga próbka; Kimi dał mu 5, 5 i 5, Grok 4, 5 i 5):

Zakrętka z blokadą sprawia, że kubek nie przecieka w plecaku ani w torbie, więc możesz go tam schować na czas podróży.

Mistral połączył dwa fakty z briefu w zdanie bez sensu, bo uchwytu samochodowego nie zabiera się ze sobą:

Zakrętka z blokadą zapobiega wyciekom, dzięki czemu bezpiecznie zabierzesz go w plecaku, torbie czy uchwycie samochodowym.

DeepSeek, najniżej oceniony, przepisał do tekstu informację dla copywritera:

To propozycja dla osób od 25 do 45 lat.

Co z tego wynika dla marketera

Ograniczenia

To mały test: jedno zadanie, jeden produkt, dwa teksty na model. Kolejność modeli w środku tabeli może się zmienić przy kolejnym przebiegu, różnice między miejscami od drugiego do czwartego są mniejsze niż rozrzut ocen między sędziami. Sędziowie to modele, nie ludzie, a uwagi redakcyjne zaznaczała jedna osoba. Nie testowaliśmy Bielika: tego dnia nie mieliśmy do niego dostępu przez OpenRouter ani na własnym sprzęcie. Wyniki opisują stan z 3 października 2026 r.; modele zmieniają się co kilka tygodni.

Łącznie test kosztował 1,19 USD, z czego 0,85 USD to ocena sędziów. Pojęcia z tego wpisu, takie jak prompt i LLM, wyjaśniamy w słowniku.

← Wszystkie wpisy Laboratorium