• мы

Проверка модели интеллектуального анализа данных в сравнении с традиционными методами оценки возраста по зубам у корейских подростков и молодых людей.

Спасибо за посещение сайта Nature.com. Версия используемого вами браузера имеет ограниченную поддержку CSS. Для достижения наилучших результатов мы рекомендуем использовать более новую версию вашего браузера (или отключить режим совместимости в Internet Explorer). В настоящее время, для обеспечения дальнейшей поддержки, сайт отображается без стилей и JavaScript.
Зубы считаются наиболее точным показателем возраста человека и часто используются в судебно-медицинской оценке возраста. Наша цель состояла в том, чтобы проверить достоверность оценок возраста по зубам, основанных на методах интеллектуального анализа данных, путем сравнения точности оценки и эффективности классификации при пороговом значении в 18 лет с традиционными методами и оценками возраста, основанными на методах интеллектуального анализа данных. Всего было собрано 2657 панорамных рентгеновских снимков граждан Кореи и Японии в возрасте от 15 до 23 лет. Они были разделены на обучающий набор, каждый из которых содержал 900 корейских снимков, и внутренний тестовый набор, содержащий 857 японских снимков. Мы сравнили точность классификации и эффективность традиционных методов с тестовыми наборами моделей интеллектуального анализа данных. Точность традиционного метода на внутреннем тестовом наборе немного выше, чем у модели интеллектуального анализа данных, и разница невелика (средняя абсолютная ошибка <0,21 года, среднеквадратичная ошибка <0,24 года). Эффективность классификации при пороговом значении в 18 лет также схожа между традиционными методами и моделями интеллектуального анализа данных. Таким образом, традиционные методы могут быть заменены моделями интеллектуального анализа данных при проведении судебно-медицинской оценки возраста с использованием степени зрелости вторых и третьих моляров у корейских подростков и молодых взрослых.
Определение возраста по зубам широко используется в судебной медицине и детской стоматологии. В частности, из-за высокой корреляции между хронологическим возрастом и развитием зубов, оценка возраста по стадиям развития зубов является важным критерием для определения возраста детей и подростков1,2,3. Однако для молодых людей оценка возраста по зубам на основе зрелости зубов имеет свои ограничения, поскольку рост зубов практически завершен, за исключением третьих моляров. Юридическая цель определения возраста молодых людей и подростков состоит в предоставлении точных оценок и научных доказательств достижения ими совершеннолетия. В судебно-медицинской практике в отношении подростков и молодых совершеннолетних в Корее возраст оценивался с использованием метода Ли, а юридический порог в 18 лет был предсказан на основе данных, представленных О и др.5.
Машинное обучение — это тип искусственного интеллекта (ИИ), который многократно обучается и классифицирует большие объемы данных, самостоятельно решает задачи и управляет программированием данных. Машинное обучение может обнаруживать полезные скрытые закономерности в больших объемах данных⁶. В отличие от этого, классические методы, которые являются трудоемкими и занимают много времени, могут иметь ограничения при работе с большими объемами сложных данных, которые трудно обрабатывать вручную⁷. Поэтому в последнее время было проведено множество исследований с использованием новейших компьютерных технологий для минимизации человеческих ошибок и эффективной обработки многомерных данных⁸,⁹,¹⁰,¹¹,¹². В частности, глубокое обучение широко используется в анализе медицинских изображений, и сообщалось о различных методах оценки возраста путем автоматического анализа рентгенограмм для повышения точности и эффективности оценки возраста¹³,¹⁴,¹⁵,¹⁶,¹⁷,¹⁸,¹⁹,²⁰. Например, Халаби и др.¹³ разработали алгоритм машинного обучения на основе сверточных нейронных сетей (CNN) для оценки скелетного возраста с использованием рентгенограмм рук детей. В этом исследовании предлагается модель, которая применяет машинное обучение к медицинским изображениям и показывает, что эти методы могут повысить точность диагностики. Ли и др.14 оценили возраст по рентгеновским снимкам таза с помощью глубокого обучения на основе сверточной нейронной сети (CNN) и сравнили их с результатами регрессии, используя оценку стадии оссификации. Они обнаружили, что модель глубокого обучения на основе CNN показала такую ​​же эффективность оценки возраста, как и традиционная регрессионная модель. В исследовании Го и др. [15] оценивалась эффективность классификации по возрастной толерантности с помощью технологии CNN на основе стоматологических ортофотоснимков, и результаты модели CNN показали, что люди превзошли ее по эффективности классификации возраста.
Большинство исследований по оценке возраста с использованием машинного обучения применяют методы глубокого обучения13,14,15,16,17,18,19,20. Сообщается, что оценка возраста на основе глубокого обучения более точна, чем традиционные методы. Однако такой подход предоставляет мало возможностей для представления научной основы оценок возраста, например, используемых в оценках возрастных показателей. Также существует юридический спор о том, кто проводит проверки. Поэтому оценка возраста на основе глубокого обучения трудно принимается административными и судебными органами. Интеллектуальный анализ данных (DM) — это метод, который может обнаруживать не только ожидаемую, но и неожиданную информацию, являясь способом выявления полезных корреляций между большими объемами данных6,21,22. Машинное обучение часто используется в интеллектуальном анализе данных, и как интеллектуальный анализ данных, так и машинное обучение используют одни и те же ключевые алгоритмы для обнаружения закономерностей в данных. Оценка возраста на основе развития зубов основана на оценке врачом зрелости целевых зубов, и эта оценка выражается в виде стадии для каждого целевого зуба. DM может использоваться для анализа корреляции между стадией оценки зубов и фактическим возрастом и имеет потенциал заменить традиционный статистический анализ. Таким образом, если мы применим методы ДМ к оценке возраста, мы сможем использовать машинное обучение в судебно-медицинской оценке возраста, не опасаясь юридической ответственности. Было опубликовано несколько сравнительных исследований возможных альтернатив традиционным ручным методам, используемым в судебно-медицинской практике, и методам определения возраста по зубам на основе доказательной медицины. Шен и др.23 показали, что модель ДМ точнее, чем традиционная формула Камерера. Галибург и др.24 применили различные методы ДМ для прогнозирования возраста в соответствии с критерием Демирджана25, и результаты показали, что метод ДМ превзошел методы Демирджана и Виллемса в оценке возраста французского населения.
Для оценки зубного возраста корейских подростков и молодых взрослых в корейской судебно-медицинской практике широко используется метод Ли⁴. Этот метод использует традиционный статистический анализ (например, множественную регрессию) для изучения взаимосвязи между корейскими субъектами и хронологическим возрастом. В данном исследовании методы оценки возраста, полученные с использованием традиционных статистических методов, определяются как «традиционные методы». Метод Ли является традиционным методом, и его точность была подтверждена О и др.⁵; однако применимость оценки возраста на основе модели DM в корейской судебно-медицинской практике все еще вызывает сомнения. Наша цель состояла в том, чтобы научно подтвердить потенциальную полезность оценки возраста на основе модели DM. Цель данного исследования состояла в том, чтобы (1) сравнить точность двух моделей DM при оценке зубного возраста и (2) сравнить эффективность классификации 7 моделей DM в возрасте 18 лет с эффективностью, полученной с использованием традиционных статистических методов. Зрелость вторых и третьих моляров в обеих челюстях.
Средние значения и стандартные отклонения хронологического возраста по стадиям и типам зубов представлены в дополнительных таблицах S1 (обучающая выборка), S2 (внутренняя тестовая выборка) и S3 (внешняя тестовая выборка). Значения коэффициента Каппа для внутри- и межнаблюдательской надежности, полученные на обучающей выборке, составили 0,951 и 0,947 соответственно. Значения P и 95% доверительные интервалы для значений коэффициента Каппа приведены в дополнительной таблице S4. Значение коэффициента Каппа было интерпретировано как «почти идеальное», что соответствует критериям Ландиса и Коха26.
При сравнении средней абсолютной ошибки (MAE) традиционный метод немного превосходит модель DM для всех полов и на внешнем мужском тестовом наборе, за исключением многослойного перцептрона (MLP). Разница между традиционной моделью и моделью DM на внутреннем тестовом наборе MAE составила 0,12–0,19 года для мужчин и 0,17–0,21 года для женщин. Для внешнего тестового набора разница меньше (0,001–0,05 года для мужчин и 0,05–0,09 года для женщин). Кроме того, среднеквадратичная ошибка (RMSE) немного ниже, чем у традиционного метода, с меньшей разницей (0,17–0,24, 0,2–0,24 для внутреннего мужского тестового набора и 0,03–0,07, 0,04–0,08 для внешнего тестового набора). MLP демонстрирует немного лучшие результаты, чем однослойный перцептрон (SLP), за исключением случая с женским внешним тестовым набором. Для показателей MAE и RMSE внешний тестовый набор демонстрирует более высокие результаты, чем внутренний, для всех полов и моделей. Все значения MAE и RMSE приведены в таблице 1 и на рисунке 1.
MAE и RMSE традиционных и интеллектуальных регрессионных моделей. Средняя абсолютная ошибка MAE, среднеквадратичная ошибка RMSE, однослойный перцептрон (SLP), многослойный перцептрон (MLP), традиционный метод CM.
Эффективность классификации (с пороговым значением 18 лет) традиционных и DM-моделей была продемонстрирована с точки зрения чувствительности, специфичности, положительной прогностической ценности (PPV), отрицательной прогностической ценности (NPV) и площади под кривой рабочей характеристики приемника (AUROC) 27 (Таблица 2, Рисунок 2 и Дополнительный рисунок 1 в онлайн-версии). Что касается чувствительности внутреннего набора тестов, традиционные методы показали лучшие результаты среди мужчин и худшие среди женщин. Однако разница в эффективности классификации между традиционными методами и SD составляет 9,7% для мужчин (MLP) и всего 2,4% для женщин (XGBoost). Среди DM-моделей логистическая регрессия (LR) показала лучшую чувствительность у обоих полов. Что касается специфичности внутреннего набора тестов, было отмечено, что четыре модели SD показали хорошие результаты у мужчин, в то время как традиционная модель показала лучшие результаты у женщин. Различия в эффективности классификации для мужчин и женщин составляют 13,3% (MLP) и 13,1% (MLP) соответственно, что указывает на то, что разница в эффективности классификации между моделями превышает чувствительность. Среди моделей DM модели опорных векторов (SVM), дерева решений (DT) и случайного леса (RF) показали наилучшие результаты среди мужчин, в то время как модель LR показала наилучшие результаты среди женщин. AUROC традиционной модели и всех моделей SD был больше 0,925 (метод k-ближайших соседей (KNN) у мужчин), что демонстрирует превосходную эффективность классификации при различении образцов 18-летнего возраста28. На внешнем тестовом наборе наблюдалось снижение эффективности классификации с точки зрения чувствительности, специфичности и AUROC по сравнению с внутренним тестовым набором. Более того, разница в чувствительности и специфичности между эффективностью классификации лучшей и худшей моделей составляла от 10% до 25% и была больше, чем разница на внутреннем тестовом наборе.
Чувствительность и специфичность моделей классификации в интеллектуальном анализе данных по сравнению с традиционными методами с пороговым значением 18 лет. KNN (k-ближайший сосед), SVM (машина опорных векторов), LR (логистическая регрессия), DT (дерево решений), RF (случайный лес), XGB (XGBoost), MLP (многослойный персептрон), традиционный метод CM.
Первым шагом в этом исследовании было сравнение точности оценок дентального возраста, полученных с помощью семи моделей ДМ, с точностью, полученной с использованием традиционной регрессии. MAE и RMSE были оценены во внутренних тестовых наборах для обоих полов, и разница между традиционным методом и моделью ДМ варьировалась от 44 до 77 дней для MAE и от 62 до 88 дней для RMSE. Хотя традиционный метод в этом исследовании оказался немного точнее, трудно сделать вывод о том, имеет ли такое небольшое различие клиническое или практическое значение. Эти результаты показывают, что точность оценки дентального возраста с использованием модели ДМ практически такая же, как и у традиционного метода. Прямое сравнение с результатами предыдущих исследований затруднено, поскольку ни одно исследование не сравнивало точность моделей ДМ с традиционными статистическими методами, используя ту же методику регистрации зубов в том же возрастном диапазоне, что и в этом исследовании. Галибург и др.24 сравнили MAE и RMSE между двумя традиционными методами (метод Демиржиана25 и метод Виллемса29) и 10 моделями ДМ во французской популяции в возрасте от 2 до 24 лет. Они сообщили, что все модели DM были точнее традиционных методов, с разницей в 0,20 и 0,38 года по MAE и 0,25 и 0,47 года по RMSE по сравнению с методами Виллемса и Демирджиана соответственно. Расхождение между моделью SD и традиционными методами, показанное в исследовании в Халибурге, учитывает многочисленные сообщения30,31,32,33 о том, что метод Демирджиана неточно оценивает зубной возраст в популяциях, отличных от франкоязычных канадцев, на которых было основано исследование. В данном исследовании Тай и др.34 использовали алгоритм MLP для прогнозирования зубного возраста по 1636 ортодонтическим фотографиям китайцев и сравнили его точность с результатами методов Демирджиана и Виллемса. Они сообщили, что MLP обладает более высокой точностью, чем традиционные методы. Разница между методом Демирджиана и традиционным методом составляет <0,32 года, а методом Виллемса — 0,28 года, что аналогично результатам настоящего исследования. Результаты этих предыдущих исследований24,34 также согласуются с результатами настоящего исследования, и точность оценки возраста с помощью модели DM и традиционного метода схожа. Однако, основываясь на представленных результатах, мы можем лишь с осторожностью заключить, что использование моделей DM для оценки возраста может заменить существующие методы из-за отсутствия сравнительных и эталонных предыдущих исследований. Для подтверждения результатов, полученных в данном исследовании, необходимы последующие исследования с использованием больших выборок.
Среди исследований, проверяющих точность SD при оценке зубного возраста, некоторые показали более высокую точность, чем наше исследование. Степановский и др. 35 применили 22 модели SD к панорамным рентгенограммам 976 жителей Чехии в возрасте от 2,7 до 20,5 лет и проверили точность каждой модели. Они оценили развитие в общей сложности 16 верхних и нижних левых постоянных зубов, используя критерии классификации, предложенные Муррисом и др. 36. MAE варьируется от 0,64 до 0,94 лет, а RMSE — от 0,85 до 1,27 лет, что точнее, чем две модели DM, использованные в этом исследовании. Шен и др.23 использовали метод Камериере для оценки зубного возраста семи постоянных зубов левой нижней челюсти у жителей восточного Китая в возрасте от 5 до 13 лет и сравнили его с возрастом, оцененным с помощью линейной регрессии, SVM и RF. Они показали, что все три модели DM имеют более высокую точность по сравнению с традиционной формулой Камериере. Значения MAE и RMSE в исследовании Шена были ниже, чем в модели DM в данном исследовании. Повышенная точность исследований Степановского и др. 35 и Шена и др. 23 может быть обусловлена ​​включением в выборки более молодых участников. Поскольку оценка возраста участников с развивающимися зубами становится более точной по мере увеличения количества зубов в процессе развития зубов, точность получаемого метода оценки возраста может быть снижена, если участники исследования моложе. Кроме того, ошибка MLP в оценке возраста немного меньше, чем у SLP, что означает, что MLP точнее, чем SLP. MLP считается немного лучше для оценки возраста, возможно, из-за скрытых слоев в MLP38. Однако есть исключение для внешней выборки женщин (SLP 1,45, MLP 1,49). Для подтверждения того, что MLP точнее, чем SLP, в оценке возраста необходимы дополнительные ретроспективные исследования.
Также было проведено сравнение эффективности классификации модели Демиржиана и традиционного метода при пороговом значении в 18 лет. Все протестированные модели SD и традиционные методы на внутреннем тестовом наборе показали практически приемлемый уровень дискриминации для выборки 18-летних. Чувствительность для мужчин и женщин составила более 87,7% и 94,9% соответственно, а специфичность — более 89,3% и 84,7%. Показатель AUROC для всех протестированных моделей также превышает 0,925. Насколько нам известно, ни одно исследование не тестировало эффективность модели Демиржиана для классификации по 18-летнему возрасту на основе зрелости зубов. Мы можем сравнить результаты этого исследования с эффективностью классификации моделей глубокого обучения на панорамных рентгенограммах. Го и др.15 рассчитали эффективность классификации модели глубокого обучения на основе CNN и ручного метода на основе метода Демиржиана для определенного возрастного порога. Чувствительность и специфичность ручного метода составили 87,7% и 95,5% соответственно, а чувствительность и специфичность модели CNN превысили 89,2% и 86,6% соответственно. Авторы пришли к выводу, что модели глубокого обучения могут заменить или превзойти ручную оценку при классификации возрастных порогов. Результаты этого исследования показали схожую эффективность классификации; считается, что классификация с использованием моделей DM может заменить традиционные статистические методы оценки возраста. Среди моделей DM LR оказалась лучшей по чувствительности для мужской выборки и по чувствительности и специфичности для женской выборки. LR занимает второе место по специфичности для мужчин. Более того, LR считается одной из наиболее удобных в использовании моделей DM35, она менее сложна и трудна в обработке. На основании этих результатов LR была признана лучшей моделью классификации пороговых значений для 18-летних в корейской популяции.
В целом, точность оценки возраста или эффективности классификации на внешнем тестовом наборе была низкой или ниже по сравнению с результатами на внутреннем тестовом наборе. Некоторые отчеты указывают на то, что точность или эффективность классификации снижаются при применении оценок возраста, основанных на корейском населении, к японскому населению5,39, и аналогичная закономерность была обнаружена в настоящем исследовании. Эта тенденция ухудшения также наблюдалась в модели DM. Поэтому для точной оценки возраста, даже при использовании DM в процессе анализа, следует отдавать предпочтение методам, основанным на данных местного населения, таким как традиционные методы5,39,40,41,42. Поскольку неясно, могут ли модели глубокого обучения демонстрировать аналогичные тенденции, необходимы исследования, сравнивающие точность и эффективность классификации с использованием традиционных методов, моделей DM и моделей глубокого обучения на одних и тех же выборках, чтобы подтвердить, может ли искусственный интеллект преодолеть эти расовые различия в ограниченных оценках возраста.
Мы демонстрируем, что традиционные методы могут быть заменены оценкой возраста на основе модели DM в судебно-медицинской практике определения возраста в Корее. Мы также обнаружили возможность применения машинного обучения для судебно-медицинской оценки возраста. Однако существуют явные ограничения, такие как недостаточное количество участников в этом исследовании для окончательного определения результатов, а также отсутствие предыдущих исследований для сравнения и подтверждения результатов данного исследования. В будущем исследования DM следует проводить с большим количеством выборок и более разнообразными популяциями, чтобы улучшить их практическую применимость по сравнению с традиционными методами. Для подтверждения возможности использования искусственного интеллекта для оценки возраста в различных популяциях необходимы будущие исследования, в которых будет проведено сравнение точности классификации и эффективности моделей DM и глубокого обучения с традиционными методами на одних и тех же выборках.
В исследовании использовались 2657 ортографических фотографий, собранных у взрослых корейцев и японцев в возрасте от 15 до 23 лет. Корейские рентгеновские снимки были разделены на 900 обучающих наборов (19,42 ± 2,65 лет) и 900 внутренних тестовых наборов (19,52 ± 2,59 лет). Обучающий набор был собран в одном учреждении (Сеульская больница Святой Марии), а собственный тестовый набор — в двух учреждениях (Стоматологическая больница Сеульского национального университета и Стоматологическая больница Университета Ёнсе). Мы также собрали 857 рентгеновских снимков из другой популяционной базы данных (Медицинский университет Иватэ, Япония) для внешнего тестирования. Рентгеновские снимки японских испытуемых (19,31 ± 2,60 лет) были выбраны в качестве внешнего тестового набора. Данные собирались ретроспективно для анализа стадий развития зубов на панорамных рентгеновских снимках, сделанных во время стоматологического лечения. Все собранные данные были анонимными, за исключением пола, даты рождения и даты рентгеновского снимка. Критерии включения и исключения были такими же, как и в ранее опубликованных исследованиях 4, 5. Фактический возраст выборки рассчитывался путем вычитания даты рождения из даты проведения рентгенографии. Группа выборки была разделена на девять возрастных групп. Распределение по возрасту и полу представлено в таблице 3. Данное исследование проводилось в соответствии с Декларацией Хельсинки и было одобрено Институциональным наблюдательным советом (IRB) больницы Святой Марии Сеульского университета Католической Кореи (KC22WISI0328). В связи с ретроспективным характером исследования, информированное согласие не могло быть получено от всех пациентов, проходивших рентгенологическое обследование в терапевтических целях. Больница Святой Марии Сеульского университета Кореи (IRB) отменила требование о получении информированного согласия.
Стадии развития двучелюстных вторых и третьих моляров оценивались по критериям Демиркана25. Если на левой и правой сторонах каждой челюсти обнаруживался зуб одного типа, выбирался только один зуб. Если гомологичные зубы с обеих сторон находились на разных стадиях развития, выбирался зуб с более низкой стадией развития, чтобы учесть неопределенность в оценке возраста. Сто случайно выбранных рентгеновских снимков из обучающего набора были оценены двумя опытными наблюдателями для проверки межнаблюдательской надежности после предварительной калибровки для определения стадии зрелости зубов. Внутринаблюдательская надежность оценивалась дважды с интервалом в три месяца основным наблюдателем.
Пол и стадия развития вторых и третьих моляров каждой челюсти в обучающем наборе данных были оценены основным наблюдателем, обученным с использованием различных моделей DM, а фактический возраст был установлен в качестве целевого значения. Модели SLP и MLP, широко используемые в машинном обучении, были протестированы в сравнении с алгоритмами регрессии. Модель DM объединяет линейные функции, используя стадии развития четырех зубов, и объединяет эти данные для оценки возраста. SLP — это простейшая нейронная сеть, не содержащая скрытых слоев. SLP работает на основе пороговой передачи между узлами. Модель SLP в регрессии математически аналогична множественной линейной регрессии. В отличие от модели SLP, модель MLP имеет несколько скрытых слоев с нелинейными функциями активации. В наших экспериментах использовался скрытый слой всего с 20 скрытыми узлами с нелинейными функциями активации. В качестве метода оптимизации использовался градиентный спуск, а в качестве функции потерь — MAE и RMSE для обучения нашей модели машинного обучения. Наилучшая полученная модель регрессии была применена к внутреннему и внешнему тестовым наборам данных, и был оценен возраст зубов.
Был разработан алгоритм классификации, который использует степень зрелости четырех зубов на обучающем наборе для прогнозирования возраста образца (18 лет или нет). Для построения модели мы вывели семь алгоритмов машинного обучения6,43: (1) LR, (2) KNN, (3) SVM, (4) DT, (5) RF, (6) XGBoost и (7) MLP. LR — один из наиболее широко используемых алгоритмов классификации44. Это алгоритм обучения с учителем, который использует регрессию для прогнозирования вероятности принадлежности данных к определенной категории от 0 до 1 и классифицирует данные как принадлежащие к более вероятной категории на основе этой вероятности; в основном используется для бинарной классификации. KNN — один из простейших алгоритмов машинного обучения45. При получении новых входных данных он находит k данных, близких к существующему набору, а затем классифицирует их в класс с наибольшей частотой. Мы установили 3 для количества рассматриваемых соседей (k). SVM — это алгоритм, который максимизирует расстояние между двумя классами, используя функцию ядра для расширения линейного пространства в нелинейное пространство, называемое полями46. Для этой модели мы используем bias = 1, power = 1 и gamma = 1 в качестве гиперпараметров для полиномиального ядра. DT применяется в различных областях как алгоритм для разделения всего набора данных на несколько подгрупп путем представления правил принятия решений в древовидной структуре47. Модель настроена с минимальным количеством записей на узел, равным 2, и использует индекс Джини в качестве меры качества. RF — это ансамблевый метод, который объединяет несколько деревьев DT для повышения производительности с использованием метода бутстрап-агрегации, который генерирует слабый классификатор для каждого образца путем случайного многократного выбора образцов одинакового размера из исходного набора данных48. В качестве критериев разделения узлов мы использовали 100 деревьев, 10 глубин деревьев, 1 минимальный размер узла и индекс примеси Джини. Классификация новых данных определяется голосованием большинства. XGBoost — это алгоритм, который сочетает в себе методы бустинга, используя в качестве обучающих данных ошибку между фактическими и прогнозируемыми значениями предыдущей модели и увеличивая ошибку с помощью градиентов49. Это широко используемый алгоритм благодаря своей хорошей производительности и эффективности использования ресурсов, а также высокой надежности в качестве функции коррекции переобучения. Модель оснащена 400 опорными колесами. MLP — это нейронная сеть, в которой один или несколько персептронов образуют несколько слоев с одним или несколькими скрытыми слоями между входным и выходным слоями38. Используя это, можно выполнять нелинейную классификацию, где при добавлении входного слоя и получении значения результата прогнозируемое значение результата сравнивается с фактическим значением результата, и ошибка распространяется обратно. Мы создали скрытый слой с 20 скрытыми нейронами в каждом слое. Каждая разработанная нами модель была применена к внутренним и внешним наборам данных для проверки эффективности классификации путем расчета чувствительности, специфичности, PPV, NPV и AUROC. Чувствительность определяется как отношение выборки, в которой возраст оценивается в 18 лет и старше, к выборке, в которой возраст оценивается в 18 лет и старше. Специфичность — это доля выборок, в которых возраст участников меньше 18 лет, и выборок, в которых возраст оценивается как не достигший 18 лет.
Оцененные в обучающей выборке стадии развития зубов были преобразованы в числовые значения для статистического анализа. Для разработки прогностических моделей для каждого пола и получения регрессионных формул, которые можно использовать для оценки возраста, были проведены многомерная линейная и логистическая регрессия. Мы использовали эти формулы для оценки возраста зубов как для внутренних, так и для внешних тестовых наборов. В таблице 4 представлены регрессионные и классификационные модели, использованные в данном исследовании.
Надежность внутри- и межнаблюдательской оценки рассчитывалась с использованием коэффициента Каппа Коэна. Для проверки точности моделей DM и традиционной регрессии мы рассчитали MAE и RMSE, используя расчетный и фактический возраст внутреннего и внешнего тестовых наборов. Эти ошибки обычно используются для оценки точности прогнозов модели. Чем меньше ошибка, тем выше точность прогноза24. Сравните MAE и RMSE внутреннего и внешнего тестовых наборов, рассчитанные с использованием моделей DM и традиционной регрессии. Эффективность классификации с использованием 18-летнего порогового значения в традиционной статистике оценивалась с помощью таблицы сопряженности 2 × 2. Рассчитанные чувствительность, специфичность, PPV, NPV и AUROC тестового набора сравнивались с измеренными значениями модели классификации DM. Данные представлены как среднее значение ± стандартное отклонение или число (%) в зависимости от характеристик данных. Двусторонние значения P < 0,05 считались статистически значимыми. Все стандартные статистические анализы проводились с использованием SAS версии 9.4 (SAS Institute, Кэри, Северная Каролина). Модель регрессии DM была реализована на Python с использованием бэкенда Keras50 2.2.4 и Tensorflow51 1.8.0, специально предназначенного для математических операций. Модель классификации DM была реализована в среде анализа знаний Waikato Knowledge Analysis Environment и аналитической платформе Konstanz Information Miner (KNIME) 4.6.152.
Авторы подтверждают, что данные, подтверждающие выводы исследования, можно найти в статье и дополнительных материалах. Наборы данных, сгенерированные и/или проанализированные в ходе исследования, могут быть предоставлены соответствующим автором по обоснованному запросу.
Ритц-Тимме, С. и др. Оценка возраста: современное состояние дел для удовлетворения специфических требований судебно-медицинской практики. Международный журнал. Юридическая медицина. 113, 129–136 (2000).
Шмелинг, А., Райзингер, В., Гезерик, Г., и Ольце, А. Современное состояние судебно-медицинской оценки возраста живых лиц в целях уголовного преследования. Судебная медицина. Патология. 1, 239–246 (2005).
Пан, Дж. и др. Модифицированный метод оценки зубного возраста детей в возрасте от 5 до 16 лет в восточном Китае. Клиническое обследование полости рта. 25, 3463–3474 (2021).
Ли, С.С. и др. Хронология развития вторых и третьих моляров у корейцев и ее применение для судебно-медицинской оценки возраста. Журнал «Международность». Судебная медицина. 124, 659–665 (2010).
О, С., Кумагаи, А., Ким, С.Й. и Ли, С.С. Точность оценки возраста и определение порога в 18 лет на основе зрелости вторых и третьих моляров у корейцев и японцев. PLoS ONE 17, e0271247 (2022).
Ким, Дж. Ю. и др. Предоперационный анализ данных на основе машинного обучения может прогнозировать результаты хирургического лечения нарушений сна у пациентов с обструктивным апноэ сна. Наука. Отчет 11, 14911 (2021).
Хан, М. и др. Точная оценка возраста с помощью машинного обучения с участием человека или без него? Международный журнал судебной медицины. 136, 821–831 (2022).
Хан, С. и Шахин, М. От интеллектуального анализа данных к интеллектуальному анализу данных. Журнал информации. наука. https://doi.org/10.1177/01655515211030872 (2021).
Хан, С. и Шахин, М. WisRule: Первый когнитивный алгоритм для поиска ассоциативных правил. Журнал информации. наука. https://doi.org/10.1177/01655515221108695 (2022).
Шахин М. и Абдулла У. Карм: Традиционный интеллектуальный анализ данных на основе контекстно-зависимых ассоциативных правил. calculate. Matt. continue. 68, 3305–3322 (2021).
Мухаммад М., Рехман З., Шахин М., Хан М. и Хабиб М. Обнаружение семантического сходства на основе глубокого обучения с использованием текстовых данных. inform. technologies. control. https://doi.org/10.5755/j01.itc.49.4.27118 (2020).
Табиш, М., Таноли, З., и Шахин, М. Система распознавания активности в спортивных видеороликах. Мультимедиа. Инструменты и приложения https://doi.org/10.1007/s11042-021-10519-6 (2021).
Халаби, С.С. и др. Задача машинного обучения RSNA в области определения костного возраста у детей. Радиология 290, 498–503 (2019).
Ли, Ю. и др. Судебно-медицинская оценка возраста по рентгеновским снимкам таза с использованием глубокого обучения. EURO. radiation. 29, 2322–2329 (2019).
Го, Ю.С. и др. Точная классификация возраста с использованием ручных методов и глубоких сверточных нейронных сетей на основе ортогональных проекционных изображений. Internationality. J. Legal medicine. 135, 1589–1597 (2021).
Алабама Далора и др. Оценка костного возраста с использованием различных методов машинного обучения: систематический обзор литературы и метаанализ. PLoS ONE 14, e0220242 (2019).
Ду, Х., Ли, Г., Ченг, К., и Ян, Дж. Оценка возраста афроамериканцев и китайцев с учетом особенностей популяции на основе объема пульповой камеры первых моляров с использованием конусно-лучевой компьютерной томографии. Internationality. J. Legal medicine. 136, 811–819 (2022).
Ким С., Ли Ю.Х., Но Ю.К., Пак Ф.К. и О К.С. Определение возрастных групп живых людей с использованием изображений первых моляров на основе искусственного интеллекта. Наука. Отчет 11, 1073 (2021).
Стерн, Д., Пайер, К., Джулиани, Н., и Уршлер, М. Автоматическая оценка возраста и классификация возраста по большинству на основе многомерных данных МРТ. IEEE J. Biomed. Health Alerts. 23, 1392–1403 (2019).
Ченг, Ц., Ге, З., Ду, Х. и Ли, Г. Оценка возраста на основе 3D-сегментации пульповой камеры первых моляров по данным конусно-лучевой компьютерной томографии с использованием глубокого обучения и множеств уровней. Internationality. J. Legal medicine. 135, 365–373 (2021).
Ву, В.Т. и др. Интеллектуальный анализ данных в клинических больших данных: общие базы данных, этапы и методы. Мировой. медицинский. ресурс. 8, 44 (2021).
Ян, Дж. и др. Введение в медицинские базы данных и технологии интеллектуального анализа данных в эпоху больших данных. Журнал «Avid». Базовая медицина. 13, 57–69 (2020).
Шен, С. и др. Метод Камерера для оценки возраста зубов с использованием машинного обучения. BMC Oral Health 21, 641 (2021).
Галлибург А. и др. Сравнение различных методов машинного обучения для прогнозирования возраста по зубам с использованием метода стадирования Демирдяна. Internationality. J. Legal medicine. 135, 665–675 (2021).
Демирджян, А., Гольдштейн, Х. и Таннер, Дж. М. Новая система оценки зубного возраста. snort. biology. 45, 211–227 (1973).
Лэндис, Дж. Р., и Кох, Г. Г. Меры согласованности между наблюдателями по категориальным данным. Биометрия 33, 159–174 (1977).
Бхаттачарджи С., Пракаш Д., Ким С., Ким Х.К. и Чой Х.К. Текстурный, морфологический и статистический анализ двухмерной магнитно-резонансной томографии с использованием методов искусственного интеллекта для дифференциации первичных опухолей головного мозга. Медицинская информация. Ресурс. https://doi.org/10.4258/hir.2022.28.1.46 (2022).


Дата публикации: 04.01.2024