Polszczyzna sześciu modeli AI na opisie produktu
Daliśmy sześciu modelom ten sam brief na opis produktu do sklepu. Ortografia i interpunkcja bez zarzutu u wszystkich, różnice wyszły w stylu i w tym, jak model trzyma się briefu.
O co chodzi
Opis produktu do sklepu to jedno z najczęstszych zadań, które działy marketingu oddają dziś modelom. Sprawdziliśmy, jak sześć popularnych modeli radzi sobie z nim po polsku, gdy dostają identyczny brief z twardymi wymaganiami.
Brief
Produkt wymyśliliśmy na potrzeby testu, nie istnieje. Każdy model dostał ten sam tekst, jako jedną wiadomość, bez dodatkowych instrukcji.
Napisz opis produktu do sklepu internetowego.
Produkt: kubek termiczny „Szron”, 350 ml.
Fakty (używaj tylko tych, niczego nie dopisuj):
- stal nierdzewna, podwójna ścianka próżniowa
- napój zostaje gorący do 6 godzin, zimny do 12 godzin
- zakrętka z blokadą: kubek nie przecieka w plecaku ani w torbie
- mieści się w typowym uchwycie na kubek w samochodzie
- korpus można myć w zmywarce, pokrywkę myjemy ręcznie
- waga 280 g
- 4 kolory: grafit, mech, piasek, malina
- cena 119 zł
Dla kogo: osoby, które dojeżdżają do pracy samochodem, rowerem albo pociągiem, 25 do 45 lat.
Ton: rzeczowy i życzliwy, bez reklamowego zadęcia. Zwracaj się do czytelnika na „ty”.
Długość: od 80 do 120 słów.
Nie używaj słów: innowacyjny, rewolucyjny, idealny, wyjątkowy, najwyższej jakości, must-have. Nie używaj wykrzykników.
Obowiązkowo wspomnij o blokadzie zakrętki i o tym, że pokrywkę myje się ręcznie.
Forma: sam tekst opisu, bez tytułu, bez list wypunktowanych, bez emoji.
Metoda
Test zrobiliśmy 3 października 2026 r. przez OpenRouter, na domyślnych ustawieniach każdego modelu (bez zmiany temperatury i rozumowania). Każdy model napisał dwa teksty, razem 12.
| Model | Identyfikator | Dostawca |
|---|---|---|
| Claude Sonnet 5.5 | anthropic/claude-sonnet-5.5 | Claude Platform on AWS |
| GPT-6.1 Sol | openai/gpt-6.1-sol | OpenAI |
| Gemini 3.1 Pro Preview | google/gemini-3.1-pro-preview | |
| Mistral Medium 3.5 | mistralai/mistral-medium-3-5 | Mistral |
| Qwen3.8 Max (0902) | qwen/qwen3.8-max-0902 | Alibaba |
| DeepSeek V4.1 Flash | deepseek/deepseek-v4.1-flash | AtlasCloud, DeepInfra |
Gemini zamówiliśmy przez alias „gemini-pro-latest”, który tego dnia wskazywał na wersję 3.1 Pro Preview.
Każdy tekst przeszedł przez cztery sprawdzenia:
- Liczby: długość w słowach, zakazane słowa i wykrzykniki, liczby spoza briefu, pominięte fakty z briefu, forma „ty”.
- Poprawność: publiczne API LanguageTool dla języka polskiego (ortografia, interpunkcja, gramatyka).
- Redakcja: w każdym tekście zaznaczyliśmy kalki, sztywne konstrukcje, błędy sensu i miejsca, w których brief przeciekł do tekstu. Adnotacje przygotował model, a my je przejrzeliśmy przed odczytaniem ocen sędziów.
- Ślepa ocena: dwa modele spoza testowanych rodzin (Grok 4.7 od xAI i Kimi K3 od Moonshot) oceniały każdy tekst osobno, bez nazwy modelu, w skali 1 do 5: naturalność, zgodność z briefem, konkretność.
Do tego mierzyliśmy czas odpowiedzi i koszt każdego wywołania podany przez OpenRouter.
Wyniki
Wszystkie 12 tekstów zmieściło się w limicie 80 do 120 słów. Żaden nie użył zakazanego słowa ani wykrzyknika, żaden nie dopisał liczby spoza briefu. LanguageTool nie zgłosił ani jednej uwagi. Różnice zaczynają się dopiero przy stylu i przy tym, jak model czyta brief.
| Model | Średnia sędziów | Naturalność | Uwagi redakcyjne | Pominięte fakty | Forma „ty” | Czas [s] | USD za 2 teksty |
|---|---|---|---|---|---|---|---|
| GPT-6.1 Sol | 4,50 | 4,00 | 1 | 0 | 2 z 2 | 6,0 | 0,008 |
| Claude Sonnet 5.5 | 4,25 | 3,50 | 3 | 0 | 2 z 2 | 9,9 | 0,031 |
| Gemini 3.1 Pro Preview | 4,25 | 3,25 | 5 | 0 | 2 z 2 | 35,2 | 0,138 |
| Qwen3.8 Max (0902) | 4,08 | 3,50 | 2 | 0 | 1 z 2 | 100,2 | 0,052 |
| Mistral Medium 3.5 | 3,67 | 3,25 | 5 | 3 | 2 z 2 | 2,1 | 0,004 |
| DeepSeek V4.1 Flash | 3,58 | 2,75 | 4 | 0 | 1 z 2 | 14,3 | 0,002 |
Średnia sędziów to średnia z naturalności, zgodności z briefem i konkretności. Sędziowie różnili się średnio o 0,67 punktu na kryterium; Grok oceniał surowiej niż Kimi.
Qwen i Gemini przy pierwszym podejściu, z limitem 4000 tokenów odpowiedzi, zużyły limit na rozumowanie. Qwen dwa razy oddał pustą odpowiedź, Gemini raz urwał tekst w połowie słowa. Powtórzyliśmy te trzy wywołania z limitem 16 000 tokenów. Nieudane próby kosztowały razem 0,098 USD i nie ma ich w tabeli.
Cytaty
Fragment najwyżej ocenionego tekstu (GPT-6.1 Sol, druga próbka; Kimi dał mu 5, 5 i 5, Grok 4, 5 i 5):
Zakrętka z blokadą sprawia, że kubek nie przecieka w plecaku ani w torbie, więc możesz go tam schować na czas podróży.
Mistral połączył dwa fakty z briefu w zdanie bez sensu, bo uchwytu samochodowego nie zabiera się ze sobą:
Zakrętka z blokadą zapobiega wyciekom, dzięki czemu bezpiecznie zabierzesz go w plecaku, torbie czy uchwycie samochodowym.
DeepSeek, najniżej oceniony, przepisał do tekstu informację dla copywritera:
To propozycja dla osób od 25 do 45 lat.
Co z tego wynika dla marketera
- Ortografia i interpunkcja przestały być problemem. W 12 tekstach automatyczna kontrola nie znalazła nic, więc redakcję warto skupić na stylu i na faktach.
- Brief przecieka do tekstu. DeepSeek w obu tekstach wpisał wiek grupy docelowej, a trzy modele przepisały z briefu „pokrywkę myjemy ręcznie”, choć tekst miał mówić na „ty”. W briefie oddzielcie informacje dla modelu od treści, która ma trafić do klienta.
- Najlepszy wynik nie był najdroższy. GPT-6.1 Sol napisał najwyżej oceniane teksty w 6 sekund, za ok. 0,4 centa za opis. Gemini kosztował kilkanaście razy więcej i pisał sześć razy dłużej.
- Modele, które długo rozumują, potrzebują zapasu tokenów. W automatyzacji ustawcie limit wyraźnie wyżej niż długość samego tekstu, inaczej dostaniecie puste albo urwane odpowiedzi.
- Żaden tekst nie dostał od obu sędziów kompletu punktów, a nawet najlepsze teksty sędziowie opisywali jako wyliczenie faktów z briefu. Model daje dobry szkic, ostatnie poprawki robi człowiek.
Ograniczenia
To mały test: jedno zadanie, jeden produkt, dwa teksty na model. Kolejność modeli w środku tabeli może się zmienić przy kolejnym przebiegu, różnice między miejscami od drugiego do czwartego są mniejsze niż rozrzut ocen między sędziami. Sędziowie to modele, nie ludzie, a uwagi redakcyjne zaznaczała jedna osoba. Nie testowaliśmy Bielika: tego dnia nie mieliśmy do niego dostępu przez OpenRouter ani na własnym sprzęcie. Wyniki opisują stan z 3 października 2026 r.; modele zmieniają się co kilka tygodni.
Łącznie test kosztował 1,19 USD, z czego 0,85 USD to ocena sędziów. Pojęcia z tego wpisu, takie jak prompt i LLM, wyjaśniamy w słowniku.