O modelo de linguagem é o componente mais visível e o menos determinante de um sistema de inteligência artificial em produção. O que faz um sistema funcionar, e continuar funcionando quando os dados mudam, os clientes crescem e os modelos são trocados, é a engenharia de tudo o que cerca o modelo. Este livro é sobre essa engenharia. Em vez de um catálogo de ferramentas, o leitor acompanha a construção de um único sistema real, do primeiro chamado à operação em produção: um atendente cognitivo de service desk que recebe solicitações por e-mail e portal, classifica cada caso com um modelo pequeno executado localmente, consulta as políticas da empresa por recuperação híbrida com reranking, redige a resposta com citações às evidências, verifica cada afirmação, aciona ferramentas de negócio por Model Context Protocol e escala para um humano quando a confiança é insuficiente. Cada capítulo adiciona uma peça e termina com o problema que o próximo resolve. O percurso cobre telemetria de custo e latência por chamada, orçamento de janela de contexto, Small Language Models com roteamento por confiança, prompts como contratos versionados e testados, pipelines de RAG do chunking ao Graph RAG, arquiteturas multiagentes com modelos híbridos, serving em produção com vLLM e Ollama, detecção de deriva, avaliação com juiz calibrado, guardrails e as obrigações da LGPD como propriedades verificáveis da arquitetura. O fechamento apresenta os sete instrumentos de governança de IA corporativa aplicados ao sistema construído, e registra os erros reais cometidos no desenvolvimento do motor que serviu de base, lidos do próprio histórico de correções. Todo o código está em repositório público, com testes que executam sem rede, sem GPU e sem modelo instalado. Escrito por um CTO com 26 anos de engenharia de software e seis dedicados a levar IA para dentro de operações críticas em órgãos públicos, educação e infraestrutura de dados.