Infrastruktura Digio

Modele AI i procesor graficzny

Już dziś uruchamiaj agentów na zarządzanych modelach frontierowych — lub wynajmuj pojemność procesora graficznego, wdrażaj własne wagi i kieruj zadania Digio do prywatnych punktów końcowych w tym samym obszarze roboczym.

Claude, GPT, Bliźnięta Wybór modelu dla każdego agenta Wynajem GPU i BYOM
Modele zarządzane

Modele dostępne od dziś w Digio

Przypisz domyślny model do agenta lub zastąp do każdego zadania. Wykorzystanie jest mierzone w tokenach Digio z salda Twojego planu — tego samego portfela, niezależnie od tego, czy agent dzwoni do Sonnet, GPT-4o czy Gemini Flash.

Antropiczny Claude

  • Claude Opus 4.7 Flagowe rozumowanie, długi kontekst, architektura i strategia.
  • Claude Opus 4.6 Opus poprzedniej generacji zapewniający stabilną analizę o wysokiej jakości.
  • Claude Sonnet 4.6 Codzienny sterownik — kodowanie, pisanie i wieloetapowe pętle agentów.
  • Claude Sonnet 4.5 / 4 Szybkie warstwy Sonnet z natychmiastowym buforowaniem obsługiwanych obciążeń.
  • Claude Haiku 4.5 Wersje robocze, klasyfikacja i zadania podrzędne o niskim opóźnieniu.

Etykieta interfejsu użytkownika witryny B2B SaaS. Przetłumacz na naturalny pl: OpenAI

  • GPT-5.5 / GPT-5.4 / GPT-5.2 Najnowsza rodzina GPT-5 do obciążeń ogólnych i agentycznych.
  • GPT-4.1 & GPT-4o Niezawodny czat multimodalny i wykorzystanie narzędzi dla agentów produkcyjnych.
  • GPT-4o mini Ekonomiczne wyznaczanie tras dla podsumowań i lekkich kroków.
  • o3 / o3-pro / o3-mini / o4-mini Modele skoncentrowane na rozumowaniu dla matematyki, planowania i weryfikacji.
  • GPT-5.3 Codex & Codex mini Generowanie kodu, refaktoryzacja i umiejętności agenta obsługującego repo.

Google Bliźnięta

  • Gemini 2.5 Pro Badania długoterminowe i ekstrakcja strukturalna.
  • Gemini 2.5 Flash Kroki agentów o wysokiej przepustowości z konkurencyjnymi stawkami za tokeny.
  • Gemini 2.0 Flash Ultraszybkie przebiegi do analizowania, tagowania i zadań wsadowych.

Otwarte i specjalistyczne interfejsy API

  • DeepSeek Chat & Reasoner Duża wartość w przypadku zadań opartych na czacie i łańcuchu myślowym.
  • Mistral Large Opcja hostowana w Europie dla wielojęzycznych zespołów agentów.
  • Llama 3.3 70B Model klasy Open Weights za pośrednictwem API — dobrze komponuje się z prywatnym procesorem graficznym.
  • Grok 3 Model zorientowany na czas rzeczywisty dla agentów zajmujących się wiadomościami i monitoringiem społecznościowym.
  • Sonar Pro Odpowiedzi oparte na wyszukiwaniu dla agentów badawczych.
  • Command R+ Przyjazny dla RAG przepływ pracy w zakresie czatów i pobierania w przedsiębiorstwie.

Model list and token economics evolve with provider releases. Your workspace shows live options when you assign a model to an agent; Digio Tokens debit from the same balance as in pricing.

Stosowanie

Jak agenci wybierają model

Koordynator może polecić Sonnet lub Opus lub tańszy model flash w zależności od rodzaju zadania. Zaawansowani użytkownicy ustawiają wartości domyślne dla poszczególnych ról agenta — badania w Sonnet, końcowa recenzja w Opus, zbiorcze tagowanie w Haiku lub Gemini Flash.

  • Per agent — default model in agent settings; override in To do or chat when needed.

  • Metered fairly — input, output, and cached tokens map to Digio Token charges (see usage in your wallet).

  • Skills stay the same — tools and integrations work across models; only latency and cost profile change.

  • Plan limits — more agents and monthly Digio Tokens on higher tiers; top up anytime on the pricing page.

Wynajem GPU

Wynajmij procesor graficzny i uruchamiaj własne modele

Potrzebujesz dokładnego dostrojenia, szczelnego punktu kontrolnego lub przewidywalnej wyceny opartej na wnioskowaniu? Dodaj dedykowaną moc GPU do obszaru roboczego Digio, zainstaluj preferowany stos obsługujący i skieruj agentów na swój prywatny punkt końcowy.

Dedykowane instancje

Godzinowe lub miesięczne węzły GPU (klasy A100, H100, L40S) dołączone do Twojego dzierżawcy – odizolowane od innych klientów.

Twoje ciężary

Prześlij sejfy, GGUF lub usuń z rejestru; uruchom Llamę, Mistral, Qwen i niestandardowe dostrojenia.

Standardowa porcja

vLLM, TGI, Ollama lub obrazy kontenerów, które utrzymujesz — agenci Digio wywołują podstawowy adres URL zgodny z OpenAI.

Ta sama orkiestracja

Aby to zrobić, czat zespołowy, umiejętności i współpraca nie uległy zmianie — tylko zaplecze wnioskowania należy do Ciebie.

Trasowanie hybrydowe

Wysyłaj wrażliwe kroki do prywatnego procesora graficznego i używaj Claude lub GPT do badań publicznych w jednym przepływie pracy.

Kontrole korporacyjne

Komunikacja równorzędna VPC, statyczny ruch wychodzący, dzienniki audytu i listy dozwolonych modeli dla zespołów regulowanych.

Przynieś swój własny model

Zainstaluj i podłącz model niestandardowy

Typowa konfiguracja od zera do agentów wywołujących Twój punkt końcowy:

  1. Zarezerwuj procesor graficzny

    Wybierz pamięć VRAM, region i czas pracy (w trybie seryjnym czy zawsze włączonym). Magazyn na ciężarki jest dostarczany wraz z instancją lub umożliwia zamontowanie łyżki.

  2. Wdróż stos

    Uruchom udostępniający obraz lub SSH, zainstaluj sterowniki CUDA i załaduj punkty kontrolne. Kontrole stanu potwierdzają, że model jest gotowy.

  3. Zarejestruj punkt końcowy

    Dodaj podstawowy adres URL, klucz API i identyfikator modelu w ustawieniach obszaru roboczego. Digio sprawdza opóźnienie i format tokena przed uruchomieniem.

  4. Przypisz agentom

    Wybierz swój prywatny model jako domyślny dla wybranych agentów; zarządzane modele Claude/GPT pozostają dostępne obok siebie.

Wynajem procesora graficznego jest rozliczany oddzielnie od subskrypcji planu Digio. Skontaktuj się z nami w sprawie planowania wydajności, umów SLA i migracji z istniejącego klastra wnioskowania.

Często zadawane pytania

Pytania dotyczące modeli i procesorów graficznych

Wybór zarządzanych interfejsów API a wnioskowanie hostowane samodzielnie w Digio.

Czy płacę dwa razy – abonament i API?

Twoja subskrypcja Digio obejmuje infrastrukturę, agentów i dołączone tokeny Digio. Model zarządzany obciąża saldo tokenów na podstawie rzeczywistych tokenów wejścia/wyjścia. Wynajem GPU to dodatek do maszyn, którymi sterujesz.

Czy różni agenci mogą używać różnych modeli?

Tak — każdy agent może mieć swoje własne ustawienia domyślne. Zadania i czaty można zastąpić pojedynczym uruchomieniem bez zmiany globalnych ustawień domyślnych.

Jaka jest różnica między Sonnetem a Opusem?

Opus jest nastrojony na trudniejsze rozumowanie i dłuższe, spójne plany; Sonnet jest szybszy i tańszy w przypadku codziennych pętli agentów. Do podzadań woluminowych najlepiej sprawdzają się modele Haiku i klasy flash.

Czy mogę uruchomić tylko własny model i zablokować interfejsy API w chmurze?

Obszary robocze przedsiębiorstwa mogą ograniczać dostawców modeli wychodzących i kierować cały ruch agentów do punktu końcowego procesora GPU. Tryb hybrydowy jest domyślnym trybem dla większości zespołów.

Jakie rozmiary procesorów graficznych są dostępne?

Oferty zależą od regionu i zapotrzebowania — zwykle warstwy VRAM o pojemności 24–80 GB dla modeli klasy 7B–70B i węzły z wieloma procesorami graficznymi w przypadku większych stosów. Pomagamy w doborze pamięci VRAM na podstawie liczby parametrów i kwantyzacji.

Czy prywatne użycie procesora graficznego nadal zużywa tokeny Digio?

Orkiestracja (agenci, zadania, pamięć) pozostaje w ramach Twojego planu. Wnioskowanie na GPU jest rozliczane jako czas GPU; opcjonalnie możesz mierzyć wykorzystanie w formie tokena na potrzeby wewnętrznego obciążenia zwrotnego.

Wybierz modele zarządzane lub zabierz ze sobą swój procesor graficzny

Zacznij od Claude i GPT już dziś, a następnie dodaj dedykowany procesor graficzny, gdy będziesz gotowy do hostowania niestandardowych wag — ci sami agenci, te same zadania, Twoje wnioski.