#компьютерное зрение

И исследования ·18 авг 2026

Британские учёные научили AI предсказывать агрессивность рака груди по дефектам центросом

Исследователи из Саутгемптонского университета создали нейросеть CenSegNet, которая анализирует аномалии центросом (структур клетки) в опухолях и определяет, как быстро рак будет расти и давать метастазы. Проанализировали 330 000 центросом у 127 пациентов и нашли закономерности, которые помогут персонализировать лечение онкологии.

0 66
И исследования ·17 авг 2026

Google научил смартфон предсказывать диабет по фото тела точнее умных часов

Google Research представил PhotoScan — нейросеть, которая по обычному фото со смартфона оценивает состав тела (процент жира, распределение висцерального жира) и предсказывает инсулинорезистентность почти так же точно, как клинический DXA-сканер, но дешевле и доступнее. Обучена на 35 тысячах записей UK Biobank, валидирована на 677 взрослых. Точность выше, чем у BIA-датчиков в умных часах.

0 41
М модели ·12 авг 2026

Google DeepMind выпустил SL2T — первый массовый AI-переводчик жестовых языков в продуктах

Google DeepMind запустил SL2T — модель перевода жестовых языков в текст, обученную на 100 000 часах данных по 50+ языкам. Первая интеграция: диктовка ASL в Gboard и Live Transcribe на Pixel 11. Вместо набора текста глухие пользователи могут показывать жесты камере — модель переводит в реальном времени. Это первый выход технологии жестовых языков из лабораторий в массовый продукт.

0 31
И инструменты ·12 авг 2026

DeepMind выпустила SL2T — AI переводит жестовый язык в текст прямо на смартфоне

DeepMind запустила SL2T — модель для перевода жестового языка в текст в реальном времени. Глухие пользователи теперь могут жестикулировать вместо набора текста. Модель работает на смартфонах, распознаёт руки, тело и мимику одновременно, отслеживание поз — на устройстве для приватности, перевод — на сервере. Разработана с участием сообщества глухих, планируется расширение на другие жестовые языки.

0 19
И инструменты ·31 июл 2026

Трансформер для апскейла сжали до 668 КБ с помощью тернарной квантизации BitNet

Исследователи применили 1.58-битную квантизацию BitNet к vision-трансформеру Swin2SR для увеличения изображений. Модель весит всего 668 КБ в сжатом виде, работает в браузере и даёт +2.66 dB прироста качества над бикубической интерполяцией при увеличении в 2 раза.

0 130
И исследования ·23 июл 2026

GPT-5.5 провалил новый визуальный тест: 10,6% против 96,1% у людей

Новый бенчмарк ActiveVision показал критический провал передовых AI-моделей в задачах, требующих повторного анализа изображений. GPT-5.5 справился лишь с 10,6% заданий, Claude Fable 5 — с 3,5%, в то время как люди показали 96,1%. Ключевой момент: модели не могут исправить ситуацию даже написав собственный код для решения задач.

0 134
И инструменты ·2 авг 2026

GeoAI на практике: как извлекать контуры зданий из аэрофотоснимков с помощью U-Net и SAM

Детальный туториал по построению пайплайна GeoAI для извлечения контуров зданий из высокоразрешающих аэроснимков NAIP. Разбирается полный стек: от подготовки геопространственных данных и обучения U-Net с ResNet-34 до zero-shot сегментации через Grounding DINO + SAM и сравнения с Mask R-CNN. Код на Python включает обработку растров, векторизацию масок, расчёт метрик и применение на реальных данных из Microsoft Planetary Computer.

0 34
И инструменты ·23 июл 2026

NASA запустила языковую модель Google Gemma на орбиту — и она работает

NASA и Google провели первую орбитальную демонстрацию языковой модели с компьютерным зрением на спутнике Loft Orbital. Gemma 3 анализировала снимки Земли прямо на борту, описывая их текстом — без отправки гигабайтов данных на Землю. Это открывает путь к управлению спутниками обычными текстовыми командами вместо сложных операций.

0 59
И исследования ·27 июл 2026

Робототехнику учат через активность мозга: как стартапы решают проблему дефицита данных

Encord строит бизнес на производстве тренировочных данных для физических роботов, включая эксперименты с датчиками мозговых волн. Проблема в том, что для обучения манипуляторов нужны массивы данных в пять раз больше YouTube, а простой скрейпинг тут не работает — данные приходится физически создавать в специальных лабораториях, что делает их в 20 раз дороже обычного видео.

0 39
И исследования ·27 июл 2026

Apple представила GH-ESD: новый подход к поиску систематических ошибок в компьютерном зрении

Исследователи Apple разработали GH-ESD — фреймворк для выявления «срезов ошибок» (систематических сбоев) в моделях компьютерного зрения на уровне отдельных объектов. Метод использует языковые модели для генерации гипотез об ошибках, затем проверяет их через визуально-языковые модели и статистический анализ. На новом бенчмарке GESD для задач детекции объектов GH-ESD показал точность 0.73 против 0.63 у базовых методов.

0 26