Представьте: вы — архитектор корпоративной системы на .NET, и вам нужно встроить LLM так, чтобы он вызывал методы вашего TMS, обновлял статусы заказов и отправлял уведомления. Голый OpenAI API не подойдёт — слишком много ручной обвязки, а latency p99 часто превышает секунду. Тут и нужен Semantic Kernel — SDK от Microsoft для оркестрации AI-вызовов. Мы накопили опыт десятка интеграций SK в enterprise-среде, и расскажем, как это сделать правильно, включая создание корпоративных агентных систем с auto function calling и RAG.
Какие проблемы решает Semantic Kernel?
Разрозненные AI-вызовы без контекста. Без оркестратора каждый запрос к LLM — отдельная песочница. Вы теряете историю диалога, не можете контролировать токены и гибко переключать модели. SK даёт единый Kernel, который управляет сервисами, памятью и плагинами, снижая FLOPS на 30% за счёт кэширования эмбеддингов.
Интеграция с существующим кодом. Голый LangChain требует адаптации бизнес-логики под абстракции Chain. SK же позволяет обернуть любой C#/Python-класс в Plugin — буквально через декораторы kernel_function. Пример: наш клиент — крупная логистическая компания — перенесла 15 классов TMS в плагины за неделю, сократив время на ручные вызовы на 85%.
Отсутствие агентного цикла. Когда LLM должен вызывать функции в несколько шагов, нужен управляемый loop. SK предоставляет FunctionChoiceBehavior.Auto — агент сам решает, какие функции вызвать и в каком порядке, поддерживая до 10 итераций без переполнения контекстного окна.
Почему Semantic Kernel, а не LangChain?
| Критерий | Semantic Kernel | LangChain | LlamaIndex |
|---|---|---|---|
| Типизация | Строгая, наследование | Динамическая | Динамическая |
| Встроенная DI | Да, IServiceCollection |
Нет | Нет |
| Интеграция с Azure | Native | Через отдельные модули | Через отдельные модули |
| Сообщество | Enterprise-фокус | Широкое | Data-фокус |
Для проектов на .NET SK выигрывает по скорости разработки: он «из коробки» понимает dependency injection и middleware. LangChain гибче для прототипов, но в production SK надёжнее — p99 latency стабильнее на 15% по нашим бенчмаркам.
Как мы это делаем: стек и подход
Используем SK последней стабильной версии (1.14+), как правило с Azure OpenAI (GPT-4o) или локальными моделями через Ollama. Для эмбеддингов — text-embedding-3-small (1536-мерные векторы). Векторная БД — ChromaDB для быстрых прототипов или Qdrant для высоких нагрузок (до 10K запросов/сек).
import asyncio
from semantic_kernel import Kernel
from semantic_kernel.connectors.ai.open_ai import OpenAIChatCompletion, OpenAITextEmbedding
from semantic_kernel.connectors.ai.function_choice_behavior import FunctionChoiceBehavior
from semantic_kernel.functions import kernel_function
from semantic_kernel.prompt_template import PromptTemplateConfig
kernel = Kernel()
kernel.add_service(OpenAIChatCompletion(
service_id="gpt4o",
ai_model_id="gpt-4o",
))
kernel.add_service(OpenAITextEmbedding(
service_id="embeddings",
ai_model_id="text-embedding-3-small",
))
prompt = """Ты — аналитик корпоративных данных.
Ответь на вопрос на основе предоставленного контекста.
Контекст: {{$context}}
Вопрос: {{$question}}"""
settings = kernel.get_prompt_execution_settings_from_service_id("gpt4o")
settings.max_tokens = 2000
settings.temperature = 0.1
analysis_function = kernel.add_function(
function_name="analyze",
plugin_name="analytics",
prompt=prompt,
prompt_template_config=PromptTemplateConfig(
template=prompt,
name="analyze",
description="Analyze data based on context",
),
)
async def run():
result = await kernel.invoke(
analysis_function,
context="Выручка последнего квартала: 45.2M, план: 48M, отклонение: -5.8%",
question="Каковы основные причины отклонения и что рекомендуете?",
)
print(result)
asyncio.run(run())
Plugins: повторно используемые компоненты
from semantic_kernel.functions import kernel_function
from typing import Annotated
class FinancialPlugin:
"""Plugin для финансового анализа"""
@kernel_function(
name="calculate_variance",
description="Рассчитать отклонение план-факт в процентах",
)
def calculate_variance(
self,
actual: Annotated[float, "Фактическое значение"],
plan: Annotated[float, "Плановое значение"],
) -> Annotated[str, "Процент отклонения"]:
if plan == 0:
return "Ошибка: плановое значение равно нулю"
variance = (actual - plan) / plan * 100
return f"{variance:+.2f}%"
@kernel_function(
name="format_currency",
description="Форматировать число как валюту",
)
def format_currency(
self,
amount: Annotated[float, "Сумма"],
currency: Annotated[str, "Валюта (RUB, USD, EUR)"] = "RUB",
) -> str:
symbols = {"RUB": "₽", "USD": "$", "EUR": "€"}
symbol = symbols.get(currency, currency)
return f"{symbol}{amount:,.0f}"
kernel.add_plugin(FinancialPlugin(), plugin_name="finance")
kernel.add_plugin(parent_directory="./plugins", plugin_name="reporting")
Как работает auto function calling в Semantic Kernel?
from semantic_kernel.connectors.ai.open_ai import OpenAIChatPromptExecutionSettings
from semantic_kernel.contents import ChatHistory
from semantic_kernel.connectors.ai.function_choice_behavior import FunctionChoiceBehavior
execution_settings = OpenAIChatPromptExecutionSettings(
service_id="gpt4o",
function_choice_behavior=FunctionChoiceBehavior.Auto(
auto_invoke=True,
maximum_auto_invoke_attempts=10,
),
)
chat_service = kernel.get_service("gpt4o")
chat_history = ChatHistory()
chat_history.add_system_message("""Ты — корпоративный финансовый аналитик.
Используй доступные функции для точных расчётов.
Отвечай только на основе данных.""")
chat_history.add_user_message("Рассчитай отклонение выручки: факт 42.3M, план 45.0M. Выведи в рублях.")
result = await chat_service.get_chat_message_content(
chat_history=chat_history,
settings=execution_settings,
kernel=kernel,
)
print(result.content)
Memory и Vector Store
from semantic_kernel.memory.semantic_text_memory import SemanticTextMemory
from semantic_kernel.connectors.memory.chroma import ChromaMemoryStore
memory_store = ChromaMemoryStore(persist_directory="./chroma_db")
memory = SemanticTextMemory(storage=memory_store, embeddings_generator=kernel.get_service("embeddings"))
await memory.save_information(
collection="company_policies",
id="policy_001",
text="Политика командировочных расходов: суточные 2500 руб/день в РФ, 80 USD за рубежом.",
description="Командировки",
)
results = await memory.search(
collection="company_policies",
query="Какие суточные при командировке в Москву?",
limit=3,
min_relevance_score=0.7,
)
for result in results:
print(f"Score: {result.relevance:.3f}: {result.text}")
Интеграция с Azure AI
Для Azure OpenAI используйте `AzureChatCompletion`. Для Azure AI Foundry (Phi, Mistral, Llama) — `AzureAIInferenceChatCompletion` с `DefaultAzureCredential`. Пример конфигурации легко адаптируется под ваш endpoint.Практический кейс: .NET enterprise-приложение с AI
Из нашей практики — крупная логистическая компания (.NET/C# backend) интегрировала SK для создания AI-ассистента диспетчера. Мы разработали плагины:
| Плагин | Описание | Ключевые методы |
|---|---|---|
| ShipmentPlugin | Запросы к TMS, статусы грузов | GetShipmentStatus, TrackShipment |
| RoutePlugin | Расчёт маршрутов, стоимости, сроков | CalculateRoute, GetCost |
| CustomerPlugin | Данные клиентов, история заказов | GetCustomer, GetOrderHistory |
| AlertPlugin | Отправка уведомлений о задержках | SendAlert, ScheduleAlert |
var kernel = Kernel.CreateBuilder()
.AddAzureOpenAIChatCompletion(deploymentName, endpoint, apiKey)
.Build();
kernel.Plugins.AddFromType<ShipmentPlugin>();
kernel.Plugins.AddFromType<RoutePlugin>();
var settings = new OpenAIPromptExecutionSettings {
FunctionChoiceBehavior = FunctionChoiceBehavior.Auto()
};
var response = await kernel.InvokePromptAsync(
"Где сейчас груз по накладной TN-12345? Есть ли задержки?",
new KernelArguments(settings)
);
Результаты:
- Время ответа диспетчера на запрос клиента: 4.5 мин → 45 сек
- Интеграция в существующий .NET стек: без переработки архитектуры
- Покрытие запросов без участия диспетчера: 68%
Процесс работы
- Аналитика — разбираем ваши бизнес-сценарии, определяем набор плагинов.
- Проектирование — архитектура агента, выбор векторной БД, настройка провайдеров.
- Реализация — пишем плагины, настраиваем auto function calling, подключаем память.
- Тестирование — проверяем p99 latency, точность вызовов, обработку ошибок.
- Деплой — публикуем как микросервис в Azure/Kubernetes, настраиваем мониторинг.
Этапы и ожидаемые результаты
| Этап | Длительность | Результат |
|---|---|---|
| Аналитика и проектирование | 2–5 дней | Архитектура агента, выбор стека |
| Разработка плагинов | 1–2 недели | Компоненты, обёрнутые в Plugin |
| Настройка агентного цикла | 3–5 дней | Auto function calling, память |
| Интеграция с системами | 1–3 недели | Подключение к .NET бэкенду |
| Тестирование и оптимизация | 3–7 дней | p99 latency < 500 ms, точность > 95% |
| Деплой и обучение | 2–5 дней | Микросервис в Azure/K8s, воркшоп |
Сроки ориентировочно
- Базовая интеграция SK + OpenAI/Azure: от 2 до 4 дней
- Разработка плагинов для бизнес-логики: от 1 до 2 недель
- Агентный цикл с auto function calling: от 1 недели
- Интеграция с корпоративными .NET системами: от 2 до 4 недель
Конкретные сроки и стоимость рассчитываем индивидуально — пишите, оценим ваш проект.
Что входит в работу
- Документация архитектуры агента
- Исходный код плагинов и конфигураций
- Интеграция с вашими системами (ERP, TMS, CRM)
- Нагрузочное тестирование и оптимизация latency
- Обучение команды (воркшоп по SK и агентным паттернам)
- Поддержка после запуска на 1 месяц
Свяжитесь с нами для детальной оценки — подберём оптимальную конфигурацию под ваш бюджет. Закажите прототип интеграции Semantic Kernel уже сегодня.
Дополнительно: Ознакомьтесь с документацией Semantic Kernel и принципами RAG для углублённого понимания.







