Когда запускаешь челлендж по разметке лёгких, быстро понимаешь: оценка «на глаз» не работает. Нужны метрики. Не одна, а целый набор. Одни измеряют совпадение масок с эталонной разметкой, другие — аккуратность границы, третьи — практическую пригодность результата для дальнейших измерений и клинического анализа. И это не академическая придирчивость. От того, насколько стабильно модель отделяет лёгочную ткань от средостения, не теряет периферию в области рёберно-диафрагмальных синусов и не захватывает трахею, зависят объёмные расчёты, детекция очагов и вообще весь последующий конвейер обработки изображений.
Почему одной метрики недостаточно
За годы экспериментов с U-Net и более ранними методами вроде активных контуров я не раз сталкивался с обманчивой картиной: визуально маска выглядит достойно, а в числах — провал. Или наоборот: Dice зашкаливает, а модель систематически срезает плевральный край или захватывает кусочек трахеи. Для врача, просматривающего томограмму, это сразу заметно, а объёмная метрика может простить такую ошибку, потому что площадь дефекта мала относительно всего лёгочного поля.
Именно поэтому в реальной практике — при подготовке датасетов, валидации алгоритмов и тем более при интеграции в PACS-среду — мы всегда смотрим на несколько уровней одновременно:
- перекрытие предсказанной маски и эталонной разметки;
- точность границы — особенно в зонах сложной анатомии;
- устойчивость при смене протоколов сканирования и популяции пациентов;
- клиническую применимость — можно ли с этой маской дальше измерять объём долей или искать узлы;
- скорость и стабильность на реальных сериях КТ, а не только на вычищенных тестовых выборках.
Основные метрики качества сегментации лёгких
Dice coefficient
Dice coefficient — безусловный стандарт в медицинской сегментации. Он измеряет, насколько сильно пересекаются предсказанная маска и экспертная разметка: по сути, удвоенная площадь пересечения, делённая на сумму площадей. Чем ближе к единице, тем лучше модель воспроизводит эталон.
Когда мы начинали размечать лёгкие для челленджа, Dice был первой метрикой, которую все участники повесили на дашборд. Он хорошо отражает объёмное соответствие и отлично работает для быстрого сравнения архитектур — например, классического U-Net, Attention U-Net и nnU-Net на одном датасете.
Плюсы Dice:
- интуитивно понятен: 0.95 означает почти идеальное наложение;
- удобен для сравнения моделей в публикациях и на бенчмарках;
- устойчив к небольшим шумам в разметке.
Минусы Dice:
- может маскировать клинически значимые ошибки по краю — модель «съедает» плевральную щель, а общий балл почти не меняется;
- не показывает, где именно модель ошибается — в верхушках, у диафрагмы или вдоль средостения.
IoU, или Jaccard Index
IoU (Intersection over Union) — отношение площади пересечения к площади объединения двух масок. По сути, это более строгий родственник Dice: если модель ошибается по границе, IoU падает быстрее, потому что площадь объединения растёт при любом несовпадении.
В проектах, где важна точность заполнения всей лёгочной области без выбросов в средостение, я всегда смотрю IoU параллельно с Dice. Особенно это полезно, когда сравниваешь модели, обученные на разных датасетах, и хочешь понять, насколько агрессивно алгоритм захватывает фоновую область. В медицинской литературе Dice встречается чаще — он привычнее сообществу, но IoU даёт более честную картину при пограничных случаях.
Sensitivity и Specificity
Когда переходишь от здоровых лёгких к КТ с выраженной патологией, одних только метрик перекрытия становится мало. Тут в игру вступают sensitivity и specificity:
- Sensitivity показывает, какую долю реальных лёгочных пикселей модель нашла. Низкая чувствительность — это пропущенные участки, например, недосегментированные зоны эмфиземы или ателектаза.
- Specificity отвечает на вопрос: насколько хорошо модель не относит к лёгким то, что ими не является. Низкая специфичность — это захват плеврального выпота, средостения или воздуха в желудке, который модель приняла за лёгочную ткань.
Эти метрики незаменимы, когда в выборке много постоперационных изменений, выпота, консолидации. Видел кейсы, где Dice держался на 0.93, а specificity проваливалась — модель регулярно включала в маску крупные буллы, граничащие с плевральной полостью, и это ломало дальнейший анализ.
Precision
Precision — это ответ на вопрос: «Если модель назвала пиксель лёгким, насколько часто она действительно права?». Высокий precision означает мало ложных срабатываний. Когда я экспериментировал с пороговой обработкой до эпохи U-Net, precision был критичен: стоит чуть завысить порог по Хаунсфилду — и модель заливает маской средостение. В нейросетевых подходах precision помогает вовремя заметить, что алгоритм начал захватывать трахею или главные бронхи за пределами лёгочного поля.
HD95 и другие граничные метрики
Если Dice и IoU измеряют «сколько совпало», то граничные метрики — «где именно модель ошиблась». Hausdorff Distance 95% (HD95) — одна из самых полезных для клинической сегментации. Она вычисляет расстояние между границами двух масок, но игнорирует 5% самых экстремальных выбросов, что делает её гораздо устойчивее классического Hausdorff Distance.
В моей практике HD95 стала обязательной, когда мы начали готовить маски для автоматической волюметрии лёгочных узлов. Оказалось, что модель может иметь Dice 0.97, но при этом систематически ошибаться на пару миллиметров вдоль плевры. Для объёмных измерений такая систематическая ошибка недопустима. HD95 полезна в нескольких сценариях:
- перед сегментацией патологий, когда маска лёгкого служит регионом интереса;
- при расчёте объёмов и распределения вентиляции по долям;
- для контроля качества на КТ с артефактами движения или металла, где границы размыты.
Average Surface Distance
Average Surface Distance показывает среднее расстояние между поверхностями масок — усредняет все пиксели контура, а не только максимумы. Это более мягкая и стабильная метрика, чем Hausdorff, и она отлично дополняет Dice с IoU, давая интегральное представление о качестве границы без фокуса на выбросах. Если HD95 подскочила, а Average Surface Distance осталась низкой — значит, проблема в единичных грубых отклонениях контура, а не в тотальной ошибке.
Сравнение метрик в практической работе
| Метрика | Что измеряет | Когда полезна | Ограничение |
|---|---|---|---|
| Dice | Перекрытие масок | Базовая оценка качества | Может скрывать ошибки по краю |
| IoU | Общую точность области | Сравнение моделей | Строже Dice, сильнее штрафует ошибки |
| Sensitivity | Долю найденных лёгочных пикселей | Проверка пропусков | Не показывает ложные включения |
| Specificity | Долю правильно исключённых не-лёгочных пикселей | Контроль захвата фона | Слабо отражает форму |
| Precision | Точность положительных предсказаний | Оценка ложных срабатываний | Не видит пропуски |
| HD95 | Ошибку границы | Критично для анатомической точности | Менее интуитивна |
| Average Surface Distance | Среднюю дистанцию между поверхностями | Стабильная оценка контура | Не показывает редкие грубые ошибки |
Какие значения считать хорошими
Универсального порога «хорошо/плохо» для сегментации лёгких не существует. Результат всегда зависит от набора факторов: какой сканер использовался, какой протокол реконструкции, есть ли патология, насколько однородно врачи размечали эталон. Добавьте сюда возраст пациентов, толщину среза и то, сегментируется всё лёгкое целиком или отдельная доля — и станет понятно, почему нельзя просто сказать: «Dice должен быть выше 0.95».
Тем не менее, в практике я ориентируюсь на несколько принципов, которые сформировались за время работы с разметкой и участия в челленджах:
- Dice и IoU должны быть высокими и на валидации, и на отложенном тестовом наборе. Разрыв между ними — признак переобучения.
- HD95 обязана быть низкой и, главное, стабильной на разных подгруппах. Если на нормальных КТ она 1.5 мм, а на КТ с эмфиземой подскакивает до 5 мм — модель ненадёжна.
- Ошибки не должны концентрироваться в одной анатомической зоне. Если модель регулярно ошибается в области куполов диафрагмы или верхушках — это системный дефект, который требует доработки либо аугментаций, либо постобработки.
- Модель обязана сохранять качество на сложных случаях, а не только на «чистых» КТ без патологии. Именно сложные случаи — выпот, консолидация, постоперационные изменения — составляют реальную клиническую нагрузку.
Часто вижу такую картину: Dice высокий, а HD95 резко ухудшается на некоторых слайсах. Это практически всегда значит, что модель в целом попадает в объём лёгких, но изредка допускает грубые ошибки по границе — срезает плевральный край или, наоборот, выходит за пределы плевры. Для клиники это тревожный сигнал: если маска используется как регион интереса для поиска субплевральных узлов, такая ошибка может привести к пропуску очага.
На что смотреть кроме цифр
1. Визуальная проверка масок
Ни одна метрика не заменит ручного просмотра предсказанных масок. За годы работы я выработал привычку обязательно просматривать несколько типов срезов перед тем, как доверять итоговым числам:
- верхушки лёгких — здесь объём мал, и даже небольшая ошибка сильно влияет на относительную точность;
- область диафрагмы — классическая зона, где модели путают лёгкое с печенью или желудком;
- зоны около средостения — проверяю, не захватывает ли алгоритм сердце, крупные сосуды, трахею;
- участки с выпотом, ателектазом, буллами, фиброзом — здесь даже опытные врачи могут колебаться с контуром;
- исследования с шумом и артефактами движения — идеальный стресс-тест для алгоритма.
Именно визуальный контроль часто вскрывает то, что усреднённые метрики сглаживают: систематический захват небольшого участка средостения, регулярный недосегмент базальных отделов или, наоборот, включение в маску плеврального выпота.
2. Анализ по подгруппам
Одна общая метрика по всему датасету — это опасно. Я всегда рекомендую разбивать тестовую выборку как минимум на несколько страт:
- нормальные КТ без значимой патологии;
- исследования с тяжёлой патологией (диффузные заболевания, обширные консолидации);
- низкодозовая КТ — уровень шума другой, модель может повести себя неожиданно;
- данные с разных сканеров — протоколы реконструкции влияют на текстуру и контуры;
- педиатрические и взрослые случаи — анатомические пропорции разные;
- тонкие и толстые срезы — при увеличении толщины среза частичный объёмный эффект размывает границы.
Такое стратифицированное тестирование подсвечивает слабые места модели и помогает понять, где нужны доработки: может, добавить аугментаций под конкретный тип сканера, или собрать дополнительную разметку для педиатрических данных.
3. Согласованность между экспертами
Отдельная больная тема — качество эталонной разметки. Если все маски размечал один врач, оценка может быть нестабильной просто из-за индивидуального стиля: один эксперт рисует строго по плевре, другой заходит на пару пикселей в средостение. В своих проектах я всегда сравниваю не только модель с разметкой, но и разметку между экспертами — это даёт верхнюю границу достижимого качества. Если inter-rater Dice между двумя опытными врачами составляет 0.97, то требовать от модели 0.99 бессмысленно — это предел, заданный человеческой вариабельностью.
Такой подход помогает отделить реальные ошибки алгоритма от зон, где даже человек не даёт абсолютно одинаковый контур — например, в области корней лёгких, где граница между лёгочной тканью и сосудистыми структурами размыта.
Как правильно оценивать сегментацию лёгких в проекте
Шаг 1. Разделите данные
Первое и железное правило: никакой утечки информации между наборами. Нужны три независимых пула:
- training — для обучения модели;
- validation — для настройки гиперпараметров и выбора лучшей эпохи;
- test — для финальной оценки, к которой вы прикасаетесь только один раз.
Если модель выбирали, ориентируясь на метрики тестового набора, честного результата уже нет — вы неявно подогнали архитектуру под конкретную выборку.
Шаг 2. Используйте несколько метрик сразу
Минимальный набор для отчёта по сегментации лёгких, который я рекомендую во всех проектах:
- Dice — для общей картины перекрытия;
- IoU — для более строгой оценки;
- HD95 — для контроля качества границы;
- Sensitivity или Precision — чтобы понять характер ошибок (пропуски против ложных срабатываний).
Такой квартет даёт объёмное представление: вы видите и совпадение, и границу, и то, в какую сторону модель смещена.
Шаг 3. Считайте не только среднее, но и разброс
Среднее значение — лукавая вещь. Оно может выглядеть прекрасно, даже если у 10% пациентов качество сегментации неприемлемо низкое. Поэтому я всегда смотрю на распределение целиком:
- медиану — она устойчивее к выбросам;
- стандартное отклонение — показывает вариабельность;
- квартильный размах — диапазон, в который попадают 50% случаев;
- худшие 5–10% случаев — именно они определяют, можно ли доверять модели в клинике.
Если медиана Dice 0.96, а нижний перцентиль — 0.82, это значит, что для каждого десятого пациента результат будет откровенно плохим, и пускать такую модель в пайплайн без флага «требуется проверка» нельзя.
Шаг 4. Сравнивайте с клинической задачей
Целевое качество сегментации всегда определяется тем, что дальше происходит с маской. Если она используется для грубого выделения области интереса перед подачей в другую сеть — требования мягче. Если маска идёт в модуль волюметрии, где по ней считают объём долей и динамику эмфиземы — планка значительно выше, и HD95 становится критичной.
Чётко формулируйте задачу до того, как начнёте считать метрики. Иначе есть риск потратить недели на погоню за сотыми долями Dice, которые не имеют клинического значения, и упустить систематическую ошибку по границе.
Типичные ошибки при оценке
Перепутать хорошую визуализацию с хорошей метрикой
Красивая картинка — это ещё не качественная сегментация. И наоборот: численно хороший результат может выглядеть посредственно. Нужны оба уровня контроля. У меня было несколько случаев, когда визуально маска выглядела почти идеально, но метрики показывали провал — просто потому, что человеческий глаз прощал небольшие, но систематические отклонения по контуру.
Сравнивать модели только по Dice
Классическая ловушка: две модели показывают Dice 0.95, и кажется, что они одинаково хороши. Но одна при этом имеет HD95 2 мм, а другая — 6 мм. Для сегментации лёгких, где важна точная граница, это критичная разница. Одна модель может быть пригодна для волюметрии, другая — только для грубого выделения зоны интереса. Без граничных метрик вы эту разницу не увидите.
Не учитывать патологию
На КТ с выраженной патологией метрики практически всегда падают — и это нормально. Проблема возникает, когда этот факт игнорируется и модель оценивают по смешанной выборке, где 90% нормальных исследований маскируют провал на оставшихся 10% сложных. Отдельный анализ по подгруппам сложности — не опция, а необходимость.
Игнорировать предобработку
Размер среза, нормализация интенсивностей по окну Хаунсфилда, ресэмплинг до единого разрешения, постобработка бинарной маски — всё это влияет на итоговые метрики иногда сильнее, чем архитектура сети. Я не раз сталкивался с тем, что модель казалась «плохой» просто потому, что данные подавались без правильной нормализации, или постобработка морфологическими операциями сглаживала важные детали контура. Перед тем как списывать алгоритм, проверьте весь пайплайн подготовки данных.
Практический чек-лист оценки
Вот минимальный список действий, который я прохожу для каждого проекта по сегментации лёгких:
- Проверьте Dice на валидации и тесте — разрыв не должен превышать пары процентов.
- Добавьте IoU для контроля строгости — если он заметно ниже Dice, модель имеет проблемы по границе.
- Обязательно посмотрите HD95 или среднюю дистанцию поверхности — минимум одну граничную метрику.
- Разбейте тест на подгруппы по типу КТ и патологии — ищите, где модель проседает.
- Сравните результаты с ручной разметкой на сложных случаях визуально — слайс за слайсом.
- Проверьте, нет ли систематической ошибки в верхушках, у диафрагмы и в зоне средостения — это классические проблемные регионы.
- Убедитесь, что итоговая маска пригодна для следующего шага пайплайна, будь то волюметрия, детекция очагов или сегментация долей.
Какие метрики чаще всего используют в исследованиях
Просматривая публикации по сегментации лёгких за последние несколько лет, я вижу устойчивый консенсус по набору метрик. В большинстве статей фигурируют:
- Dice как базовая метрика — без неё не обходится ни одна работа;
- HD95 как основной показатель качества границы — стал стандартом де-факто;
- Average Surface Distance для более тонкой и стабильной оценки контура;
- иногда Sensitivity и Precision для анализа характера ошибок — особенно в работах, где важен баланс между пропусками и ложными срабатываниями.
Такой набор информативен именно тем, что даёт не только итоговый балл «хорошо/плохо», но и понимание того, как именно модель ошибается — теряет ли она лёгочную ткань, захватывает ли средостение или даёт грубые выбросы по границе. Для клинической и исследовательской практики это гораздо ценнее одного-единственного числа.
FAQ
Какая метрика самая важная для сегментации лёгких?
Если нужно выбрать одну, большинство специалистов назовут Dice — он хорошо отражает общее перекрытие масок и удобен для сравнения моделей. Но опираться только на него — путь к неверным выводам. Для реальной, честной оценки лучше всегда добавлять HD95 и одну из метрик точности, чтобы видеть и границу, и характер ошибок.
Почему Dice высокий, а результат всё равно плохой?
Это происходит, когда модель уверенно сегментирует основной объём лёгких, но систематически ошибается на границе или в анатомически сложных зонах. Например, регулярно срезает плевральный край в базальных отделах или включает в маску небольшой участок средостения. Для клинического использования такие локальные дефекты могут оказаться важнее, чем высокий средний Dice по всему датасету.
Что важнее для КТ лёгких: Dice или HD95?
Обе метрики отвечают на разные вопросы, и противопоставлять их некорректно. Dice показывает общий объём совпадения, HD95 — качество границы. Для сегментации лёгких я всегда использую их вместе: Dice даёт быструю сравнимость с литературой, HD95 — уверенность в анатомической точности. Одно без другого оставляет слепые зоны в оценке.
Нужно ли вручную проверять каждую маску?
Если сегментация применяется в исследовательском или, тем более, клиническом сценарии, выборочная ручная проверка обязательна — это не опция, а требование. Полностью полагаться только на числа нельзя: визуальный контроль выявляет систематические ошибки и артефакты, которые метрики могут сгладить до статистической невидимости. Обычно я просматриваю все случаи из нижнего перцентиля по метрикам и ещё случайную выборку из середины распределения — этого достаточно, чтобы понять реальную картину.