Após um modelo ser treinado, ou seja, ele aprendeu (oculto) padrões a partir do conjunto de dados fornecido, o modelo precisa ser implementado. Ao implementar o modelo, é possível enviar novos dados para o modelo e obter uma "previsão" para o registro de dados indicado. Isso também é chamado de Servindo Modelo ou Inferenciando.
Um cluster Kubernetes pode ser configurado para fornecer contêineres de CPU (baratos) e GPU para o Model Serving.
Além disso, um grande número de solicitações pode ser enviado ao Model Server ao mesmo tempo. Para processar essas solicitações de "inferência" em tempo hábil, o Kubernetes permite escalar o Model Server "sob demanda".
Aqui temos 2 casos:
Autoscaling: adicionando (clonagem) novos recipientes sob demanda.
Escala para zero: permite eficiência de custo e pagamento por uso, desligando contêineres ociosos.
A implementação de um modelo no SAP AI Core consiste em escrever um aplicativo da Web capaz de atender às solicitações de inferência por meio de um ponto de acesso exposto na Internet, que pode ser facilmente escalado na infraestrutura do Kubernetes.

Aplicação servindo
Para servir um modelo, você codifica e desenvolve uma aplicação de serviço que será executada na forma de um container.
Tudo começa com uma solicitação de inferência enviada para um ponto de acesso. Internamente, o aplicativo da Web deve interpretar os dados contidos no corpo da chamada e, em seguida, recuperar o modelo do armazenamento de objetos em hiperescala, aplicá-lo aos dados e embalar a previsão em uma resposta que será consumida por um serviço personalizado.

Nota
A codificação é fundamental, mas, como mencionado anteriormente, o servidor do modelo que será implementado é definido por um modelo específico. Este modelo autônomo criará um executável com a definição dos parâmetros necessários, o container a ser executado, os recursos necessários para iniciar a aplicação Web e o número de réplicas do servidor de modelo a ser iniciado.
Essa combinação do executável de atendimento adequado, com a referência ao modelo a ser usado, permitirá que o SAP AI Core inicie sua implementação.
Quando o servidor do modelo está em execução e o URL de implementação está pronto, a etapa final do fluxo de trabalho de ML no SAP AI Core é o consumo do modelo por meio do ponto de acesso exposto. A API pode ser facilmente integrada em qualquer aplicativo de negócios usando uma solicitação http, como um notebook Jupyter, Postman ou um aplicativo CAP, etc.