SimSms

1 Serviço 1.296 serviços em estoque

Escolha um serviço

2 País 145 países

Escolha um país

3 Rede e preço

Escolha um serviço e um país — em qualquer ordem. O preço e a rede aparecem aqui.

Hospedagem própria de modelos de IA: as contas que ainda pedem um número de telefone

Pesos abertos são baixados com um único comando e uma GPU é alugada por segundo — a computação deixou de ser a parte difícil. O atrito está em tudo ao redor: a plataforma do bot, o registry, o hub, cada um parando para pedir um número de telefone no pior momento possível. Quais realmente exigem um, e onde um código único é a resposta certa.

Um caminho pontilhado que sai de uma placa de GPU brilhante, faz uma curva pelo quadro e termina dentro de um painel de telefone, em um único ponto laranja

Rodar um modelo de linguagem em um hardware alugado, a partir de pesos que você mesmo baixou, é a parte disso tudo que silenciosamente se tornou fácil. Um comando baixa o modelo, outro inicia o servidor, e tudo é cobrado por segundo. O que não é fácil é tudo ao redor: o hub que restringe o download, a plataforma em que o modelo deve responder, o registry que guarda seu container, o painel que mostra que a GPU ainda está ativa. Vários desses vão parar e pedir um número de telefone, e vão pedir no momento menos conveniente.

Este guia trata dessa lacuna. Quanto custa, de fato, rodar uma configuração com hospedagem própria, quais das contas ao redor realmente exigem um número e quais só parecem exigir, e onde um código único é a ferramenta certa — e onde não é.

O que a hospedagem própria realmente envolve #

Um modelo com hospedagem própria tem quatro partes móveis, e só uma delas é o modelo.

  • Computação — uma GPU com memória suficiente para carregar os pesos, alugada por hora ou por segundo. É a única parte cobrada continuamente.
  • Pesos — baixados uma vez a partir de um hub de modelos. A maioria dos modelos de pesos abertos está a um simples login de distância; alguns ficam atrás de uma solicitação de acesso.
  • Uma interface — aquilo com que as pessoas de fato conversam: um bot do Telegram, um bot do Discord, um endpoint web, uma API interna.
  • Infraestrutura de apoio — um registry de containers, algum lugar para guardar segredos, e algo que monitora a máquina.

Os pedidos de telefone nunca vêm do modelo. Eles vêm da interface e da infraestrutura de apoio, que são contas comuns de consumidor e de desenvolvedor com regras comuns antiabuso associadas.

A computação é alugada, e é a parte barata #

Possuir a placa deixou de fazer sentido para a maioria das pessoas já faz um tempo. Um hardware capaz de carregar um modelo de 70B sem quantização custa mais que um carro usado e fica ocioso a maior parte da semana; a mesma placa alugada por segundo custa menos que um delivery para uma noite de trabalho. A cobrança por segundo é o detalhe que importa — uma tarefa que leva quatro minutos deve custar quatro minutos, não uma hora arredondada para cima.

GPU O que ela comporta com folga Sob demanda, por hora
RTX 2070, 8 GB Conversão de fala em texto, embeddings, classificadores pequenos $0.032
RTX 4090, 24 GB Um modelo de 7B–14B em velocidade máxima, geração de imagens $0.262
H100 SXM, 80 GB Um modelo de 70B sem quantização, execuções de fine-tuning $1.512

Essas são as taxas sob demanda publicadas na PowerGPU, que lista 79 modelos NVIDIA e define cada preço com base na mediana do mercado público em vez de rodar um leilão, de modo que o valor exibido na página é o valor que você paga. A cobrança é por segundo, o pagamento é em cripto, e não há nenhuma verificação de identidade entre você e a primeira instância. Para um projeto que você mantém deliberadamente separado do seu próprio nome, esse último ponto é, sozinho, o motivo para procurar ali em vez de em um hyperscaler.

Quais contas pedem um número, e quando #

Os pedidos não são distribuídos igualmente. Algumas plataformas priorizam o telefone e simplesmente não abrem uma conta sem um número; outras só pedem quando algo na sessão parece incomum. Descobrir em qual caso você está economiza tanto dinheiro quanto um número desperdiçado.

Conta Quando o pedido aparece Um código resolve
Telegram, para um bot Na criação da conta — não existe caminho só com e-mail Sim. O caso mais claro desta lista
Discord, para um bot Em alguns cadastros, e sempre que uma conta é sinalizada Sim — embora normalmente tenha sido a sinalização que provocou isso, não o cadastro
Um hub de modelos Raramente no cadastro; às vezes em modelos restritos ou ações de organização Geralmente sim, nas ocasiões em que chega a aparecer
Um host de código ou registry Na ativação da autenticação de dois fatores, em que o SMS é uma opção entre várias Possível, mas um aplicativo autenticador é a resposta melhor aqui
Um provedor de API de IA Uma vez, no cadastro, antes da emissão da primeira chave Sim, um único código único

Vale separar dois padrões, porque eles pedem produtos diferentes. Um número pedido uma vez, no cadastro, é um portão: você passa por ele e ele não volta. Um número pedido depois, em um login que a plataforma não reconheceu, é um desafio: ele pode voltar, e vai voltar para o mesmo número. Escolher como se um desafio fosse um portão é o erro mais comum e mais caro de todo esse processo.

Código único, ou um número que você mantém #

Se a conta só for pedir uma vez, um código único é exatamente o certo: pegue um número para o serviço em questão, o código chega, o número volta. Se a conta é algo em que você vai entrar de novo a partir de máquinas novas — um bot que ainda estará rodando daqui a seis meses — o número precisa continuar existindo quando o desafio chegar. É para isso que serve um número alugado, e é a diferença entre uma conta que você mantém e uma conta que você perde silenciosamente.

A ordem que funciona #

  1. 1 Decida a interface primeiro Se o modelo responde no Telegram, no Discord ou em um endpoint simples decide, sozinho, quais contas você precisa. Um endpoint HTTP simples em uma máquina alugada não exige nenhuma conta de consumidor — se isso atende ao seu projeto, você acabou de eliminar todo pedido de telefone desta página.
  2. 2 Crie as contas antes de alugar a GPU As contas são a parte que pode travar por uma hora. A GPU é cobrada a partir do segundo em que é iniciada. Deixe a demora acontecer enquanto nada está rodando.
  3. 3 Peça o número com o pedido já na tela Chegue até o campo que está pedindo, deixe-o aberto, e só então peça o código. Um código é cobrado quando chega, e ele chega independentemente de você estar pronto para ele. A página de números do Telegram e a página de números do Discord listam os países que atendem cada serviço atualmente.
  4. 4 Vincule um segundo fator imediatamente No momento em que a conta existir, adicione um aplicativo autenticador e salve os códigos de recuperação. É isso que evita que a plataforma precise chegar até o seu número de novo — noventa segundos de trabalho que eliminam uma categoria inteira de problema futuro.
  5. 5 Só então inicie a instância Com as contas resolvidas, alugue a GPU, baixe os pesos, inicie o servidor. Daqui em diante o medidor está rodando e nada deveria mais interromper você.

O que um número virtual não faz #

Vale ser direto sobre os limites, porque as falhas são previsíveis.

  • Ele não torna uma conta anônima por si só. A conta ainda tem um e-mail, um rastro de pagamento e uma impressão comportamental; o número é apenas um identificador entre vários.
  • Ele não contorna um serviço que rejeita especificamente faixas não móveis — veja por que os serviços rejeitam VoIP.
  • Ele não desfaz uma sinalização. Se uma plataforma já decidiu que uma conta parece suspeita, um código novo resolve o desafio à sua frente, não o motivo que o gerou.
  • Ele não substitui um segundo fator. Um número é um canal de reserva; um aplicativo autenticador é o que mantém a conta sua.

Se um código para de chegar no meio da configuração, a causa quase nunca é o modelo ou a máquina — por que seu código de verificação nunca chegou cobre o punhado de motivos pelos quais isso realmente acontece.

O formato de uma configuração que se sustenta #

A versão disso que sobrevive ao contato com a realidade é sempre muito parecida. Computação alugada por segundo e paga em cripto, de modo que a conta corresponde ao trabalho e a instância pode desaparecer junto com o projeto. Pesos mantidos localmente, para que ninguém possa revogar o acesso ao seu próprio modelo. Uma interface escolhida para exigir o menor número possível de contas de consumidor. E, para as contas que você realmente não consegue evitar, um número que está ali uma vez para o portão, ou que ainda está ali daqui a seis meses para o desafio — escolhido deliberadamente, não pelo que era mais barato naquele dia.

A computação se tornou a parte fácil. Planeje as contas com o mesmo cuidado com que você planeja a GPU, e o resto para de ser interessante — o que, para infraestrutura, é o objetivo inteiro.

Leia também