AI Россия

AI Россия

AI Россия · корпоративные бенчмарки и практика внедрения

10 новостей
01
benchmarksllmenterprise

Сбер развивает 1C Code Bench для оценки LLM на задачах 1С

Команда Сбера продолжает расширять 1C Code Bench — специализированный бенчмарк для проверки качества кода, который генерируют LLM для платформы 1С. Проект показывает, как крупные компании переводят разговор об AI в измеримые метрики и прикладную проверку.

Habr Сбер
02
agentsragtesting

Сбер описал собственный инструмент для бенчмаркинга AI-агентов

Сбер представил внутренний подход к тестированию AI-агентов для GraphRAG-системы: от архитектуры и надёжности до интеграции с Airflow. Такой контур позволяет быстрее проверять гипотезы и снижает риск ошибок при изменении промптов, контекста и внешних интеграций.

Habr Сбер
03
testingllmautomation

Сбер показал централизованное AI-тестирование для крупных команд

В компании выстроили единый контур автоматизации тестирования на базе Perfeccionista-framework, RAG и MCP-сервера для работы с LLM. Решение должно уменьшить хаос из разрозненных фреймворков и сделать AI-поддержку тестирования управляемой.

Habr Сбер
04
benchmarkscodingllm

Сбер обновил практику оценки AI-кода через 1C Code Bench

Проект 1C Code Bench получил развитие спустя несколько месяцев после запуска: команда расширяет набор задач и дорабатывает методику проверки. Для рынка это важный сигнал о том, что качество AI-кода начинают измерять не по демо, а по воспроизводимому бенчмарку.

Habr Сбер
05
open-sourceinfrastructuregrants

Яндекс поддержал open source-проекты для AI-экосистемы

Yandex Open Source распределил гранты между проектами, связанными с базами данных и инструментами для AI-экосистем. Поддержка инфраструктурных решений важна не меньше, чем сами модели: именно она формирует слой для обучения, поиска и развёртывания.

Habr Яндекс
06
cloudobservabilityinfrastructure

VK Cloud показал новые сценарии мониторинга и работы с AI-инфраструктурой

На VK Cloud Conf 2026 компания продемонстрировала практические сценарии для наблюдаемости и диагностики в облаке, включая мониторинг ошибок на толстом клиенте. Для AI-команд такие инструменты критичны: без них не удержать стабильность сложных продуктовых контуров.

Habr AI
07
agentsarchitecturedevtools

Архитектура проекта под AI-агентов: как удержать границы кода

Автор разобрал, как перестроил крупный проект, чтобы AI-агенты не размывали архитектуру и не ломали критичные участки кода. Акцент сделан на жёстких правилах через линтеры и CI вместо надежды на инструкции в документации.

Habr AI
08
testingqualityllm

Мутационное тестирование вскрыло слабые места AI-сгенерированного кода

Эксперимент показал, что даже при хорошем покрытии тестами AI-агент может оставлять уязвимые места в коде. Мутационное тестирование выявило, что часть проверок лишь исполняет код, но не защищает от регрессий.

Habr AI
09
ragenterprisesecurity

GraphRAG для отделов с разграничением доступа вынесли в отдельный форк

Появился self-hosted GraphRAG-проект с учётом ролей, изоляции документов и настройкой промптов под разные подразделения. Для корпоративного рынка это практичный шаг: AI-системы всё чаще проектируются под доступ, а не только под поиск.

Habr NLP
10
copyrightdatapolicy

Журналисты нашли следы обучения ИИ на миллионах защищённых песен

The Atlantic сообщил о доказательствах использования миллионов музыкальных записей, защищённых авторским правом, при обучении нейросетей. История усиливает давление на AI-компании в вопросах лицензий, согласия правообладателей и прозрачности датасетов.

3DNews