DeepDigest
← все статьи
LLM

LLM

724 статьи по теме

cs.AI
arXiv
Cornell University Library
arXiv cs.AI

Новый подход к оценке точности языковых моделей: как избежать ошибок в анализе текстов

Кайли Энглин предложила методы более точной оценки производительности классификаторов для текстов: протестировала разные способы расчёта доверительных интервалов и выявила лучшие подходы.

читать →
~1 мин 1684 просмотра
Ars Technica AI

OpenAI: выручка растёт, но убытки остаются огромными

OpenAI демонстрирует быстрый рост выручки, однако расходы компании, особенно на НИОКР, остаются значительно выше доходов. Ежедневные операционные и чистый убытки продолжают расти. Чтобы выйти на прибыль к 2030 году, OpenAI придётся оптимизировать затраты и повысить отдачу от инвестиций.

читать →
~2 мин 693 просмотра
Ars Technica AI

Пентагон использует ИИ для подготовки отчётов для Конгресса

Пентагон начал использовать инструменты ИИ для подготовки отчётов для Конгресса — это позволяет существенно сократить время на их составление. Число сотрудников Минобороны, применяющих средства ИИ, резко выросло. Эксперты предупреждают о рисках ошибок в таких отчётах.

LLM
читать →
~2 мин 1214 просмотра
Ars Technica AI

Кори Доктороу о рисках пузыря ИИ и концепции «обратного кентавра»

Кори Доктороу в новой книге рассуждает о рисках, связанных с развитием ИИ, и вводит понятие «обратного кентавра» — ситуации, когда человек становится вспомогательным элементом для машины. Автор обеспокоен чрезмерными инвестициями в ИИ и возможными экономическими последствиями «лопания пузыря» в этой сфере. Он также связывает популярность ИИ с мечтой о полностью автономных системах.

LLM
читать →
~2 мин 766 просмотра
Ars Technica AI

Берни Сандерс предложил план контроля над индустрией ИИ за 7 трлн долларов

Берни Сандерс выдвинул план создания суверенного фонда за счёт 50‑процентного налога на акции крупнейших ИИ‑компаний. Фонд может достичь 7 трлн долларов, средства направят на выплаты гражданам и финансирование социальных программ. Представители индустрии ИИ не разделяют радикальности предложений сенатора.

читать →
~2 мин 886 просмотра
Ars Technica AI

Anthropic приостановила изменение тарифов для Claude Agent SDK

Anthropic приостановила запланированное повышение тарифов для Claude Agent SDK — пользователи сохранят прежние условия. Изменения, анонсированные на 15 июня, могли увеличить расходы активных пользователей, в том числе тех, кто использует сторонние приложения. Решение принято на фоне изменений в тарификации GitHub Copilot и подготовки Anthropic к IPO.

LLM
читать →
~2 мин 1534 просмотра
AI Snake Oil

GPT-4 и другие ИИ: почему не заменят инженеров-программистов

Авторы эссе доказывают, что опасения по поводу замены инженеров-программистов ИИ преувеличены. На примерах из бизнеса показано, что увольнения часто объясняют влиянием ИИ, хотя реальные причины иные. Данные исследований также не подтверждают массового сокращения рабочих мест из‑за внедрения ИИ.

читать →
~3 мин 1075 просмотра
IEEE Spectrum AI

7 способов преуспеть в ИИ: советы для начинающих инженеров

Локеш Лагуду из IEEE и Walmart Global Tech дал советы начинающим инженерам, как преуспеть в сфере ИИ. Он рекомендует осваивать технические навыки, изучать принципы работы LLM и GPT, участвовать в бенчмарках и применять знания на практике. Также важно следить за исследованиями и развивать междисциплинарные навыки.

читать →
~1 мин 832 просмотра
IEEE Spectrum AI

Как измерить влияние ИИ на общество: призыв эксперта

Ванесса Бейтс Рамирес призывает оценивать влияние моделей ИИ не только по их производительности, но и по тому, как они воздействуют на общество. Эксперт считает, что нужны специальные показатели для анализа социальных последствий применения ИИ. Это поможет лучше понимать последствия внедрения технологий.

LLM
читать →
~1 мин 749 просмотра
cs.CL
arXiv
Cornell University Library
arXiv cs.CL

ProvenAI: как проверить, откуда взялись ответы ИИ

ProvenAI — фреймворк для оценки соответствия ответов ИИ источникам: проверяет правильность, цитирование и влияние источников. Тестировался на HotpotQA, показал точность ответов 53,53 %, цитирования — 71,55 %.

читать →
~1 мин 1925 просмотра
cs.CL
arXiv
Cornell University Library
arXiv cs.CL

AnySimLite: новый способ классификации речи на смартфоне без потери качества

AnySimLite — лёгкая модель для классификации речи на устройствах: занимает мало памяти, сохраняет высокую точность. Показала конкурентоспособные результаты.

читать →
~1 мин 1156 просмотра
cs.CL
arXiv
Cornell University Library
arXiv cs.CL

ProfileFoundry: новый инструмент для тестирования LLM-агентов

ProfileFoundry — генератор синтетических данных для оценки работы LLM-агентов: память, конфиденциальность, работа с документами. 100 тыс. профилей, более 700 тыс. событий.

читать →
~1 мин 1797 просмотра
cs.CL
arXiv
Cornell University Library
arXiv cs.CL

Небольшие языковые модели ускоряют анализ данных о взаимодействии человека и робота

Небольшие языковые модели ускоряют анализ данных о spHRI, помогая обнаруживать пропущенные рецензентами статьи.

читать →
~1 мин 1052 просмотра
cs.CL
arXiv
Cornell University Library
arXiv cs.CL

ConflictScore: новый способ оценить, как языковые модели справляются с противоречиями

ConflictScore — метрика для оценки реакции языковых моделей на противоречивые данные; включает тест ConflictBench и показатели CS-C и CS-R.

читать →
~1 мин 1806 просмотра
cs.CL
arXiv
Cornell University Library
arXiv cs.CL

Новый взгляд на взаимодействие зрения и языка в ИИ: систематизированный обзор мультимодальных моделей

Авторы представили систематический обзор объединения зрительного восприятия и языкового мышления в MLLM, ввели пятиэтапную таксономию и обозначили перспективы создания унифицированного мультимодального интеллекта.

читать →
~1 мин 1239 просмотра
cs.CL
arXiv
Cornell University Library
arXiv cs.CL

ИИ для языков с ограниченными ресурсами: новый подход на основе WordNet

Разработан метод создания диалоговых ИИ‑систем для языков с ограниченными ресурсами на базе WordNet: преобразовали Hindi WordNet в 1,25 млн пар «инструкция‑ответ», настроили языковую модель — эффективность достигла 91,0.

читать →
~1 мин 1273 просмотра
cs.CL
arXiv
Cornell University Library
arXiv cs.CL

LLM сужают выбор методов исследований: новое исследование выявило риски

Исследование показало, что LLM (GPT-5.1, Gemini 3 Pro, DeepSeek-V3.2) предлагают слишком узкий набор методов для исследований, есть перекосы в выборе подходов — это несёт риски для учёных.

читать →
~1 мин 2057 просмотра
cs.CL
arXiv
Cornell University Library
arXiv cs.CL

Большие языковые модели: в чём их ключевое преимущество?

Разработана платформа AdvCluster для анализа преимуществ крупных языковых моделей; доказано, что они эффективнее работают с ограничениями в логических задачах.

читать →
~1 мин 1273 просмотра
cs.CL
arXiv
Cornell University Library
arXiv cs.CL

Эмоциональные аватары на языке жестов: новый способ общения на непальском

Создан мультимодальный фреймворк NEST-V1: он превращает непальские слова в жесты аватаров с учётом эмоций. Точность распознавания речи — 81,1%, эмоций — 79,21%.

читать →
~1 мин 1493 просмотра
cs.CL
arXiv
Cornell University Library
arXiv cs.CL

Dynamic-dLLM: в 3 раза быстрее — новый способ ускорить работу диффузионных LLM

Dynamic-dLLM ускоряет работу диффузионных LLM более чем в 3 раза за счёт динамического обновления кэша и адаптивного декодирования. Протестировано на LLaDA и Dream, в системах MMLU, GSM8K, HumanEval.

читать →
~1 мин 1438 просмотра