weightsapi.INFERENCJAKonsola
Nawigacja
Jak to działa

Od zadania do jaśniejszego przepływu pracy wnioskowania.

Zrozum zarządzane wnioskowanie, wybierz model, przygotuj żądanie i śledź zależności między środkami, zarezerwowanymi kwotami a wykorzystaniem.

W skrócie

Wybierz model, ustaw kontrolę dostępu i wydatków, a następnie śledź użycie zapytań i status płatności. Sprawdź dostępność modelu przed wysłaniem ruchu.

Zrozum, czym zarządza usługa

Wnioskowanie zarządzane umieszcza obsługę modelu za API, dzięki czemu Twoja aplikacja może żądać odpowiedzi bez uruchamiania serwera GPU. WeightsAPI używa formatu żądań zgodnego z OpenAI dla modeli o otwartych wagach; sprawdź status usługi, aby poznać dostępność.

Nadal jesteś właścicielem aplikacji: jej promptów, wyboru danych, uprawnień, zachowania ponowień i kontroli wyników. Zacznij od konkretnego zadania i zdecyduj, jak powinna wyglądać przydatna odpowiedź. Przewodnik po przypadkach użycia oferuje punkty wyjścia, nie obiecując, że każdy model obsługuje wszystkie funkcje.

Wybierz model do rzeczywistego zadania

Skorzystaj z katalogu modeli, aby porównać możliwości, licencje, kontekst i stawki wejścia/wyjścia. Przeczytaj stronę modelu, a następnie użyj jego dokładnego identyfikatora API w żądaniu. Odróżnij natywny kontekst wydawcy od potwierdzonego limitu wdrożenia: dane wejściowe i zamierzony wynik muszą mieścić się w tym drugim.

Wpis w katalogu nie dowodzi, że wdrożenie jest dostępne. Funkcja odkrywania modeli wyświetla podłączone wdrożenia, gdy backend jest dostępny. Porównaj odpowiednie stawki na stronie cen, zamiast zakładać, że wszystkie modele kosztują tyle samo.

Przygotuj małe, łatwe do sprawdzenia żądanie

Zacznij od krótkiego promptu, dokładnego identyfikatora modelu i ograniczonego wyniku. Szybki start wyjaśnia format chat-completions. Dodaj tylko historię konwersacji potrzebną do zadania, a poświadczenia API trzymaj na swoim serwerze.

Strumieniowanie jest opcjonalne: dostarcza odpowiedź w zdarzeniach, a nie jako jedną kompletną odpowiedź. Przeczytaj przewodnik po strumieniowaniu przed jego włączeniem, w tym jak obsługiwać przerwane odpowiedzi i końcowy rekord użycia.

Rozdziel dostęp i wydatki

Zaloguj się do konsoli. Utwórz osobne klucze dla aplikacji lub środowisk, ustaw dodatni limit wydatków i w razie potrzeby ogranicz dozwolone modele. Zapisz sekret przy pierwszym wyświetleniu.

Limit klucza dotyczy łącznego zarejestrowanego użycia i zaległych rezerwacji, a nie miesięcznego przydziału. Wymień ujawnione klucze i unieważnij stare. FAQ wyjaśnia, jak klucze, środki i oczekujące żądania są ze sobą powiązane.

Dostęp do AI wymaga zalogowania, jednego potwierdzonego doładowania w wysokości co najmniej 100 USD, autoryzowanego klucza API i wystarczających dostępnych środków na żądanie. Każde kolejne doładowanie również ma minimum 100 USD; mniejsze pozostałe salda pozostają użyteczne, gdy pokrywają żądanie. Środki wymagają weryfikacji transakcji. Sprawdź status usługi, aby poznać dostępność modeli przed wysłaniem ruchu.

Odróżnij dostępne środki od ostatecznego kosztu

Dla przyjętego płatnego żądania dostępne środki pokrywają dane wejściowe i maksymalny wynik przed rozpoczęciem generowania. Ostateczny koszt uwzględnia rzeczywiste użycie wejścia/wyjścia; początkowa rezerwacja nie jest ostateczną opłatą. Żądania oczekujące na rozliczenie mogą zatem zmniejszać dostępne środki.

Jeśli odpowiedź zatrzyma się przed potwierdzeniem ostatecznego użycia, rezerwacja może pozostać do czasu uzgodnienia. Zlecenie finansowania zawiera instrukcje płatności; środki wymagają weryfikacji transakcji. Przejrzyj sekcję rozliczenia, aby poznać terminy wycen, potwierdzenia i dostępne środki.

Przejrzyj wynik przed rozszerzeniem

W przypadku pytań dotyczących dokumentów niech Twoja aplikacja wybierze odpowiednie fragmenty, zażąda odpowiedzi z cytatami i sprawdzi te cytaty w źródłach. Zachowaj uprawnienia do dokumentów i ostateczny przegląd w swojej aplikacji.

Oceń jakość odpowiedzi, wykorzystanie kontekstu i oczekiwane koszty na reprezentatywnych przykładach. Rozszerzaj dopiero po przetestowaniu wymaganych możliwości. W przypadku błędów, przerwanych strumieni lub oczekujących środków postępuj zgodnie z przewodnikiem wsparcia i zachowaj zanonimizowany raport.

Potrzebujesz kolejnego kroku?

Znajdź odpowiedni przewodnik lub przygotuj szczegóły swojego problemu.

Otwórz wsparcie