
Zeynep Tüfekçi
@zeynep · Norteamérica
Zeynep Tüfekçi forma parte del seguimiento de Storyz World sobre periodismo y actualidad vinculado a Estados Unidos, en el capítulo de América del Norte.
Segunda acusación de que trabajos matemáticos previos fueron incorporados a un modelo de IA. Cabe señalar que, incluso con más transparencia y un mejor comportamiento, es posible que OpenAI siga sin poder «descartar que datos desidentificados derivados de su uso de nuestros productos hayan ayudado a mejorar nuestros modelos», entre otras vías.
Traducido de inglésLo que realmente está mal es precipitarse a informar sobre una afirmación sin el contexto. Además, si se reconoce la solución (¿por qué no?), ¿representa lo que se suponía que debía incentivar el Premio del Milenio? El objetivo de una medalla de maratón no es dársela a personas que pueden llegar a la meta patinando sobre ruedas. Los cambios en los métodos/procesos no son detalles incidentales. El problema de existencia y suavidad de Navier–Stokes es muy interesante, pero no es una cuestión práctica. El proceso/método es clave para entender lo que realmente significa el avance. +
Traducido de inglésNuestros benchmarks habituales de IA no son tan útiles. Nos estamos deslumbrando con logros que no necesariamente tendrán las consecuencias implícitas que la gente espera. Esto se parece un poco a cómo las grandes manifestaciones masivas no tienen la misma capacidad de hacer caer gobiernos que en la era anterior a internet. (Sí, mi libro).
Traducido de inglésEs probable que la IA en la ciencia y la investigación sean ámbitos que decepcionen las expectativas del público. Sí, vi el anuncio de Navier-Stokes y sí, lo creo independientemente de la controversia sobre el mérito. La ciencia en general podría incluso enfrentarse a *vientos en contra* por culpa de la IA. Unos pocos esfuerzos espectaculares no cambian eso.
Traducido de inglésCreo que la IA es una tecnología transformadora de gran importancia. ¡Espero muchos impactos! Simplemente creo que la mayoría de los benchmarks actuales no son muy útiles y que las predicciones sociales no están ocurriendo de acuerdo con los benchmarks de IA de la manera que muchas personas afirmaban!
Traducido de inglésNo es siquiera que «el mapa no sea el territorio», sino que los benchmarks actuales de IA ni siquiera son el mapa. Y si dejamos de lado los estados de ánimo de los pódcasts y miramos empíricamente, está claro que las teorías predominantes sobre aquello para lo que se suponía que esos benchmarks serían un indicador indirecto de la sociedad SON ERRÓNEAS HASTA AHORA.
Traducido de inglésNada de eso es una prueba directa de impactos sociales concretos, aunque el dinero gastado es obviamente trascendental. Pero todo eso puede ocurrir incluso si la IA no afecta mucho al empleo y aunque ralentice la ciencia y tenga otros impactos novedosos.
Traducido de inglésNo creo que los benchmarks de IA sean indicadores indirectos de la sociedad. Son *entradas* de un sistema complejo. Necesitamos una teoría coherente de *cómo*. Por ejemplo, creo que la ciencia podría *ralentizarse*. Los benchmarks están subiendo, pero la ciencia como proceso bien podría verse obstaculizada por la IA, independientemente de que resuelva problemas de Erdős.
Traducido de inglésLos benchmarks de IA por sí solos no implican impactos ni consecuencias más amplios. En absoluto. Además, creo que la mayoría de nuestros benchmarks son bastante inútiles para reflexionar sobre los impactos sociales, y que esto ya es evidente empíricamente, PERO incluso si fueran útiles, ¡no lo serían por sí solos!
Traducido de inglésJa. Un giro interesante en esto es la alta sensibilidad de los LLM a la frecuencia de las entradas (lo que constituye otra razón clave por la que no son tan utilizables económicamente a gran escala fuera de dominios limitados): las lagunas como fracaso.
Traducido de inglésLa orientación de un modelo de IA hacia la persuasión limita enormemente su utilidad económica A GRAN ESCALA, obviamente. Por eso, todos los ejemplos aislados e impresionantes no son tan relevantes. Por ejemplo, hace poco le pedí a un modelo de pago un resumen de lo que sabemos sobre las consecuencias de un escenario en el que NO se toma el camino X. La mayoría de los estudios siguen lo que ocurre si SÍ se toma el camino X. Como de costumbre, pedí fuentes y enlaces, etc. El modelo añadió modificaciones apenas perceptibles a los títulos, resúmenes, etc. de los estudios que enumeró, para añadir «no X» al alcance del estudio. Estaba bien hecho y era sutil. Parpadeas y se te escapa. Tenías que hacer clic en cada enlace y leer una buena parte del estudio. Eso seguía siendo un poco más rápido que empezar desde cero, pero el riesgo es más peligroso que empezar desde cero si la experiencia es menor. Además, introduce otros vectores de error. Incluso los modelos más avanzados hacen versiones de esto algunas veces, y es difícil detectar estas sutiles falsificaciones persuasivas sin una cantidad considerable de trabajo adicional, que requiere tanto experiencia como tiempo. Es cierto que otras veces tampoco lo hacen, pero buena suerte diferenciando los casos sin esa experiencia y esfuerzo. El software tiene que funcionar en lugar de persuadir, así que, aparte del aspecto de la verificabilidad, es otro juego.
Traducido de inglés