Jednostka 3 / 10

Szczegółowe informacje o nas, gigantach: anthropic, openai, google

Zyski:

  • Pasujące silne pola i typowy użytkownik rodzin Claude, GPT i Gemini
  • Możliwość odczytania logiki poziomu (warstwy) i nazewnictwa modeli każdego dostawcy
  • Wyrób sobie nawyk opierania porównań na własnych danych testowych, a nie na twierdzeniach marketingowych

Zmapowaliśmy rynek i poznaliśmy różnicę w wadze zamkniętej i otwartej. Teraz poznamy trzech najbardziej widocznych graczy na rynku, a mianowicie dużych dostawców z USA: Anthropic (Claude), OpenAI (GPT) i Google (Gemini). Te trzy elementy są obecnie podejmowane w większości decyzji dotyczących sztucznej inteligencji przedsiębiorstw. Naszym celem nie jest ogłoszenie „zwycięzcy”; Celem jest obiektywne zrozumienie, gdzie każdy z nich się wyróżnia, jego logika nazewnictwa i typowy użytkownik. Kiedy rozdział zostanie ukończony, będziesz mógł mówić o tych trzech rodzinach, nie myląc ich, i zdasz sobie sprawę, że porównanie powinieneś oprzeć na własnym teście, a nie na reklamie.

Wspólna logika: system poziomów

Wszyscy ci trzej dostawcy kierują się podobną logiką: oferują modele z tej samej rodziny, ułożone według proporcji szybkości/kosztu/mocy. Zwykle są trzy poziomy:

  • Poziom lekki: najszybszy i najtańszy. Do prostych zadań o dużej objętości (klasyfikacja, odprawa, etykietowanie).
  • Zrównoważony stopień: moc i koszt średniej klasy. „Domyślny” wybór dla większości codziennych zadań.
  • Silny poziom: Najbardziej wydajny, najdroższy, najwolniejszy. Do złożonego rozumowania, długich analiz, trudnego kodu.

Gdy zrozumiesz tę logikę poziomów, nie poczujesz się zagubiony, niezależnie od tego, którego dostawcę wybierzesz. „Jaki poziom odpowiada temu modelowi w tej rodzinie?” Wystarczy zapytać.

Wskazówka: gdy usłyszysz o nowym modelu, najpierw zapytaj „który poziom jakiej rodziny?” zapytać. Nie pozwól, aby mnogość imion Cię przeraziła; Każdy dostawca faktycznie oferuje te same trzy poziomy pod różnymi nazwami.

Antropiczny — Rodzina Claude

Rodzina Claude firmy Anthropic oferuje trzy poziomy: Opus (silny), Sonnet (zbalansowany) i Haiku (lekki). Uwzględniono także numery wersji; Przykładowo model używany przez tę platformę to claude-opus-4-8, czyli wersja 4.8 sceny Opus.

Wyróżnia się: przetwarzaniem długiego kontekstu (możliwość czytania w całości stustronicowych dokumentów), pisaniem i odczytywaniem kodu oraz bezpiecznym, przewidywalnym zachowaniem w zastosowaniach korporacyjnych. Claude jest znany z tego, że trzyma się blisko instrukcji i zachowuje równowagę w delikatnych sprawach. Dlatego jest często preferowany w sektorach regulowanych, takich jak prawo, finanse i zdrowie.

Typowy użytkownik: zespoły prawne analizujące długie dokumenty, zespoły zajmujące się oprogramowaniem przeglądające kod, obsługa klientów korporacyjnych wymagająca bezpiecznych wyników.

Aktualne modele antropiczne i przybliżone ceny (za milion tokenów, wejście/wyjście):

modelka

Scena

Kontekst

Wprowadź $/1 milion

Wyjście $/1M

Klaudiusz Opus 4.8

silny

1 milion tokenów

~5

~25

Klaudiusz Sonnet 5

zrównoważony

1 milion tokenów

~3

~15

Klaudiusz Haiku 4.5

lekki

200 tys. tokenów

~1

~5

Uwaga: Ceny te są cenami przybliżonymi i dotyczą okresu, w którym moduł był przygotowywany i często ulegają zmianom. Przed podjęciem decyzji koniecznie sprawdź aktualną stronę cenową dostawcy. Logikę cen omówimy szczegółowo w szóstej części.

OpenAI — rodzina GPT

Rodzina GPT OpenAI jest najbardziej rozpoznawalną marką na rynku i posiada największy ekosystem stron trzecich; oznacza to, że wiele narzędzi programowych, wtyczek i integracji jest wydawanych najpierw dla GPT. Rodzina GPT jest również wielopoziomowa: istnieją szybkie i tanie modele (lekkie opcje, takie jak na przykład GPT-4o mini), zrównoważone, wszechstronne modele (GPT-4o) i modele wymagające intensywnego myślenia, takie jak „seria O”, skupiające się szczególnie na rozumowaniu.

Obszary, w których się wyróżnia: wszechstronność i powszechność. Szeroki zakres możliwości dla tekstu, kodu, obrazów i dźwięku; dojrzały ekosystem pojazdów; i szerokie wsparcie społeczne. „Czy można wykonać pracę za pomocą sztucznej inteligencji?” GPT jest zwykle gotowym punktem wyjścia.

Typowy użytkownik: startupy wykonujące szybkie prototypowanie, zespoły produktowe chcące szerokiej integracji, małe i średnie firmy, które chcą wykonywać szeroki zakres zadań u jednego dostawcy.

Google — Rodzina Bliźniąt

Rodzina Google Gemini wykorzystuje dwie potężne karty: multimodalność (możliwość jednoczesnej obsługi tekstu, obrazów, dźwięku i wideo) oraz integrację z Google Workspace (praca osadzona w narzędziach takich jak Gmail, Dokumenty i Arkusze). Gemini jest również wielopoziomowe: istnieją szybkie modele „Flash” i mocniejsze modele „Pro”.

Gdzie się wyróżnia: zrozumienie treści wizualnych i wideo, ogromny kontekst i bezproblemowa integracja dla organizacji, które już intensywnie korzystają z narzędzi Google. Jeśli organizacja wykonuje całą pracę biurową w Google Workspace, Gemini jest dla niej naturalnym przedłużeniem.

Typowy użytkownik: Firmy działające w ekosystemie Google, zespoły zajmujące się treściami graficznymi/wideo, chcące przetwarzać jednocześnie bardzo duże zbiory danych.

Trzy rodziny obok siebie

Rozmiar

Antropiczny (Claude)

OpenAI (GPT)

Google (Bliźnięta)

najmocniejszy aspekt

Długi kontekst, kod, bezpieczne zachowanie

Wszechstronność, szeroki ekosystem

Multimodalność, przestrzeń robocza

Etapy

Opus/Sonet/Haiku

Mocny / zrównoważony / lekki + rozumowanie

Pro/Flash

Typowy użytkownik

Sektory regulowane

Zespoły korporacyjne i produktowe

Instytucje skupione na Google

Typ wagi

Zamknięte

Zamknięte

Zamknięte

Patrząc na ten stół, nie pytaj „który wygra”; Zapytaj „Do którego wiersza pasuje moja praca?” Jeśli masz do przeczytania 200-stronicową umowę, decydujący będzie dla Ciebie długi kontekst, a jeśli masz faktury czytane wizualnie, decydujący będzie dla Ciebie wiersz dotyczący multimodalności.

Słaba podpowiedź/silna podpowiedź: gdy prosimy o wybór rodzinny

Słaba zachęta:

Co jest lepsze: Claude, GPT czy Gemini?

Potężny monit:

Twoja rola: neutralny konsultant AI. Moja praca: Chcę tworzyć wersje robocze odpowiedzi na e-maile klientów w firmie zajmującej się handlem elektronicznym + wyodrębniać kwotę/datę z obrazów faktur przychodzących. Istnieją dwa różne zadania: (1) generowanie tekstu, (2) ekstrakcja danych z obrazu. Zadanie: Porównaj rodziny Claude, GPT i Gemini dla obu zadań. Napisz, która rodzina wyróżnia się pod względem zadań, z jakiego poziomu skorzystać i dlaczego. Nie podawaj dokładnej ceny, podaj zakres. W razie wątpliwości powiedz „test”.

Ponieważ drugi monit dzieli zadanie na dwa jasne zadania, model może zalecić odpowiednią rodzinę dla każdego zadania z osobna. Na tym też opiera się idea „portfolio modelowego”, o której dowiemy się później.

Szablony do kopiowania

Dopasowanie poziomu 1:

Definiuję następujące zadanie: [TASK]. Biorąc pod uwagę poziom trudności i objętość, który poziom rodzin Claude, GPT i Gemini (lekki/zrównoważony/mocny) poleciłbyś? Dla każdej rodziny napisz po jednym wierszu uzasadnienia.

2. Zgodność ekosystemu:

Narzędzia, z których obecnie korzystamy: [LISTA NARZĘDZI, m.in. Google Workspace / Microsoft 365). Która rodzina AI będzie najlepiej pasować do tego zestawu narzędzi i dlaczego? Oceń łatwość integracji, krzywą uczenia się i możliwe ryzyko zablokowania (zależności).

3. Walidacja mocnych stron:

Chcę przetestować twierdzenie „[NAZWA MODELU] jest w tym najlepszy” w przypadku mojego zadania [TASK]. Które 3 przykładowe testy powinienem przeprowadzić na własną rękę, aby zweryfikować to twierdzenie? Opisz w jednym zdaniu kryteria sukcesu każdego testu.

4. Rozpoznawanie nazw:

Przeanalizuj następujące nazwy modeli według rodziny, etapu i wersji i utwórz tabelę: [NAZWY MODELI]. Oznacz typowe zastosowanie każdego z nich jednym słowem.

Typowe błędy

  • Podejmowanie decyzji na podstawie reklamy: Ogłoszenie „Ten model zajął pierwsze miejsce w tym teście” może nie mówić nic o Twojej misji. Przetestuj to na własnych danych.
  • Wybór rodziny bez wyboru poziomu: Nie wystarczy powiedzieć „Będziemy używać GPT”; Który to poziom zmienia radykalnie koszt i jakość.
  • Ignorowanie blokady ekosystemu: Głębokie zaangażowanie w rodzinę ułatwia integrację, ale utrudnia w przyszłości zmianę dostawcy.
  • Brakuje tematu: Ten rynek zmienia się szybko; Porównanie sprzed pół roku może dzisiaj być nieaktualne. Oprzyj swoją decyzję na aktualnych informacjach.
  • Zmuszanie jednej rodziny do robienia wszystkiego: podczas gdy jedna rodzina błyszczy w tekście, inna może przodować w obrazie. Myśl zadanie po zadaniu.

Podsumowując

  • Anthropic, OpenAI i Google oferują tę samą logikę poziomów (lekka/zrównoważona/silna) pod różnymi nazwami.
  • Claude w długim kontekście, kodeksie i bezpiecznych zachowaniach korporacyjnych; GPT ma dużą wszechstronność i szeroki ekosystem; Gemini wyróżnia się multimodalnością i integracją Workspace.
  • „Najlepszy” różni się w zależności od stanowiska; oprzyj porównanie na własnych danych testowych, a nie na reklamach.
  • Analiza nazw modeli według rodziny + poziomu + wersji pomoże Ci odnaleźć się na zatłoczonym rynku.

Zadanie aplikacji

Zidentyfikuj dwa różne zadania w swojej pracy (jedno związane z tekstem, drugie z treściami wizualnymi lub długimi dokumentami). Korzystając z szablonu 1 (dopasowywanie poziomów) w tej jednostce, poproś model AI o poproszenie o odpowiednią rangę trzech rodzin dla każdego zadania. Następnie, korzystając z szablonu 3 (walidacja mocnych stron), zaprojektuj trzy konkretne testy, aby przetestować proponowany model na własnych danych. Testy te wykorzystamy w badaniu ewaluacyjnym w części 10.

lista kontrolna

  • [ ] Potrafię rozpoznać logikę poziomu (lekka/zrównoważona/silna) we wszystkich trzech rodzinach.
  • [ ] Claude, potrafię dopasować obszary, w których dominują GPT i Bliźnięta.
  • [ ] Potrafię wybrać odpowiednią rodzinę i zaliczyć zadanie z uzasadnieniem.
  • [ ] Znam sposoby testowania twierdzeń modelu na własnych danych.
  • [ ] Potrafię analizować nazwy modeli jako rodzina + scena + wersja.