Das breite verfügbare Informationsspektrum von Large Language Models (LLM) zusammen mit den semantisch hochwertigen Antworten machen LLMs als Informationsquelle für Laien wie medizinisches Personal attraktiv. Vor diesem Hintergrund sind Potential aber auch Risiken durch mögliche Fehlinformationen relevant. Ziel dieser Studie war daher Qualität und Sicherheit der LLMs ChatGPT4 und Bard zu verglichen.41 fallbasierte HNO-Fragen aus der Fachliteratur sowie Fragen aus deutschen Staatsexamina wurden von LLMs (ChatGPT4, Bard) sowie von 6 HNO-Fachärzten beantwortet. Es folgte eine verblindete Bewertung der Antworten durch die Fachärzte. Selbst verfasste Antworten wurden ausgespart. Die Evaluation umfasste die binären Kategorien Mensch/Maschine sowie Gefährdung des Patienten. Ferner wurden Kohärenz, Verständlichkeit, Prägnanz sowie die medizinische Qualität der Antworten auf einer 6 Punkte Likert-Skala bewertet. Die Fachärzte erzielten unter allen Bewertungskriterien bessere Ergebnisse als die LLMs. Insbesondere in der Bewertung der medizinischen Qualität schnitten die Ärzte besserer ab. Hier zeigte sich auch ein Unterschied zwischen den LLMs. Die LLMs erreichten eine hohe Sprachqualität, was sich in guten Ergebnissen in den Kategorien Kohärenz, Verständlichkeit und Prägnanz widerspiegelte. Im Durchschnitt verwendeten die LLMs mehr Zeichen als die Ärzte. Während die Antworten der LLMs verglichen mit den Ärzten eine geringere medizinische Qualität zeigten, kann die gute Sprachkompetenz ein höheres Maß an Fachwissen suggerieren. Dies könnte Nutzer verleiten Informationen als korrekt zu bewerten obwohl diese Fehler enthalten und somit ein Risiko bei breiter Nutzung darstellen. Trotzdem ist die Qualität der von den LLMs generierten Antworten insgesamt vielversprechend.
The wide range of information available from Large Lange Models (LLMs) together with the semantically high-quality responses make LLMs powerful and consequently attractive as sources of medical information for laypersons and medical staff alike. There is however risk of generating misinformation. The aim of this study was to compare the quality and safety of two popular LLMs: ChatGPT4 and Bard. 41 case-based ENT questions were posed to the two LLMs (ChatGPT4 and Bard) as well as 6 ORL consultants. A blinded evaluation of the answers was carried out by the consultants which included their opinion on whether they were generated by a consultant or a LLM and if there was potential patient risk from misinformation. In addition coherence, comprehensibility, conciseness as well as the medical quality of the answers were rated on a 6-point Likert scale. Consultants did not evaluate their own answers. Consultants achieved better results than the LLMs among all evaluation criteria. In particular, the doctors scored better in the assessment of medical quality. A difference between the two LLMs was also noted. The LLMs scored highly for semantic quality, reflected by good results in the categories of coherence, comprehensibility and conciseness. On average however the LLMs used statistically more characters than the doctors. While LLM responses exhibited notably lower medical content quality compared to consultants, their high linguistic proficiency may suggests a higher degree of expertise. This could mislead users into perceiving the information as accurate, when it may contain misinformation posing a further potential risk for widespread use. Despite this limitation in offering medical advice, the overall caliber of the responses generated by LLMs remains good.
Examination There was an exophytic, redish tumor of the lateral wall of the hypopharynx. The mobility of the vocal chords was not impaired. The glottic lumen was subtotaly obstructed by the tumor. A CT scan of the neck and a panendoscopy with an excision biopsy were performed. A Kaposi's sarcoma was diagnosed.
Introduction The use of structured findings (SR) has been shown to improve the completeness of findings, time efficiency and interrater reliability in head and neck sonography. However, no data exist to date on the influence on the precision of content in terms of correct interpretation of findings. The aim of this study was to evaluate the completeness of findings and the precision of content in the context of DEGUM-certified ultrasound courses.
Einleitung Die Anwendung strukturierter Befunde (SR) führt nachweislich zu einer Verbesserung der Befundvollständigkeit, der zeitlichen Effizienz sowie der Interrater-Reliabilität in der Kopf- und Halssonographie. Jedoch existieren bisher keine Daten über den Einfluss auf die inhaltliche Präzision im Sinne der korrekten Befundinterpretation. Ziel dieser Studie war es, die Befundvollständigkeit und die inhaltliche Präzision im Rahmen von DEGUM-zertifizierten Ultraschallkursen zu evaluieren.
Ein 52-jähriger, homosexueller Patient stellte sich mit seit vier Monaten bestehender Dysphagie und Dyspnoe ohne Stridor vor. Eine weitere Symptomatik bestand nicht.