
🧬 T.F.A.M.: cuando el prompt musical comienza antes de escribir el prompt.
🧬 T.F.A.M.: cuando el prompt musical comienza antes de escribir el prompt.
De “Prompt en Caja” a una nueva forma de organizar el tiempo musical antes de generar con inteligencia artificial
Informe de laboratorio Promt1 — 2 de septiembre de 2026
Promt1Oficial | Puerto Rico 🇵🇷
Durante meses hemos utilizado inteligencia artificial para experimentar con música cristiana, diferentes géneros, instrumentaciones, estructuras y formas de escribir instrucciones para motores generativos.
Pero esta vez decidimos regresar mucho más atrás.
Antes del prompt.
Antes de la generación.
Incluso antes de preguntarnos qué instrumento debería tocar.
La pregunta fue sorprendentemente sencilla:
¿Y el 4/4?
🤣
Aquella pregunta abrió una investigación que terminó modificando nuestra manera de pensar el diseño de una canción antes de entregársela a una inteligencia artificial.
El resultado provisional recibió un nombre:
🧬 T.F.A.M.
Tempo Full en el ADN Musical.
No pretende ser una fórmula mágica ni una garantía de que una IA musical dejará de cometer errores.
Es una metodología experimental que estamos comenzando a probar.
Y sus primeros resultados justifican continuar investigándola.
1. El compás no es el tempo
Una de las primeras cosas que necesitábamos separar correctamente era algo elemental:
4/4 = compás.
88 BPM = tempo.
Boom Bap = lenguaje o género musical.
Parecen datos sencillos, pero cumplen funciones diferentes.
El compás establece una organización métrica.
El tempo determina la velocidad.
El género aporta un lenguaje rítmico, instrumental y estilístico.
De ahí surgió una de las primeras frases del experimento:
El compás pone el piso. El género nos enseña cómo caminar sobre él.
Pero inmediatamente apareció otra pregunta:
Si conocemos el piso, ¿por qué entregar toda la letra y toda la arquitectura a la IA sin decirle cuánto espacio hemos pensado para cada cosa?
Ahí comenzó el verdadero experimento.
2. De secciones a bloques musicales
Ya trabajábamos con estructuras como:
Intro → Verso → Pre-coro → Coro → Puente → Outro.
Pero decidimos añadir otra capa.
En numerosos lenguajes musicales son comunes agrupaciones de 4, 8, 16 o 32 compases.
Importante:
no son leyes universales.
Una canción no tiene obligación de utilizar esos tamaños y diferentes géneros pueden organizar el tiempo de maneras muy distintas.
Pero podían servirnos como herramienta de diseño.
Entonces dejamos de escribir solamente:
Verso
y comenzamos a pensar:
Verso — 16 compases.
Ya no era únicamente:
Coro
sino:
Coro — 8 compases.
La arquitectura comenzó a adquirir territorio temporal.
3. Prompt en Caja 📦 + T.F.A.M. 🧬
Nuestro método anterior, Prompt en Caja, ya partía de una idea fundamental:
Un buen prompt musical no debería comenzar acumulando palabras descriptivas.
Primero debemos tomar decisiones musicales.
Entre ellas:
género;
instrumentación;
jerarquía instrumental;
compás;
BPM;
arquitectura;
energía;
comportamiento vocal.
T.F.A.M. no reemplaza ese método.
Añade resolución temporal.
Podemos explicarlo de esta manera:
📦 Prompt en Caja organiza las decisiones musicales.
🧬 T.F.A.M. intenta organizar cómo esas decisiones habitan el tiempo musical.
La fórmula experimental comenzó a tomar esta forma:
COMPÁS + GÉNERO + BPM + BLOQUES + FRASEO + ARREGLO + JERARQUÍA INSTRUMENTAL + ENERGÍA
Pero faltaba todavía una pieza importantísima.
La letra.
4. La letra también necesita espacio
Aquí ocurrió posiblemente el cambio más importante del experimento.
En lugar de tomar una letra extensa y pedir posteriormente a la IA que encontrara dónde colocarla, hicimos lo contrario.
Reducimos y dimensionamos la letra pensando en la arquitectura musical.
Dejamos espacio para:
respirar;
hacer transiciones;
permitir respuestas instrumentales;
introducir silencios;
desarrollar secciones sin voz;
y evitar que demasiadas palabras tuvieran que competir por el mismo territorio temporal.
Esto produjo otro principio:
El espacio donde no hay letra también forma parte de la composición.
Y una idea todavía más importante:
No obligamos la letra a sobrevivir dentro de la música. Diseñamos primero un lugar donde pueda vivir.
5. La prueba: “Dios es Dominio Total”
Para la primera prueba utilizamos una composición cristiana reconstruida para el experimento:
🎤 DIOS ES DOMINIO TOTAL
El mensaje fue desarrollado tomando como referencia diferentes pasajes bíblicos relacionados con el poder, dominio y soberanía de Dios, entre ellos:
Isaías 40:29–31
Job 38
Isaías 6:3
Filipenses 2:10–11
Apocalipsis 19:11–16
Apocalipsis 22:13
El objetivo musical no era llenar la canción de elementos.
Queríamos una arquitectura relativamente limpia que nos permitiera escuchar con atención el comportamiento de la voz y de la composición.
6. ADN musical experimental
La ficha quedó definida así:
Género: Christian Conscious Boom Bap Rap
Compás: 4/4
Tempo: 88 BPM
Voz: masculina en español, profunda, clara y reflexiva.
Instrumentación principal:
batería acústica Boom Bap + bajo eléctrico profundo + piano acústico oscuro.
Nada más era necesario para esta prueba.
La limitación instrumental también ayudaba a reducir variables.
7. Arquitectura T.F.A.M.
La composición fue diseñada de esta manera:
Intro — 4 compases
Verso 1 — 16 compases
Pre-coro — 4 compases
Coro — 8 compases
Intermedio — 8 compases
Verso 2 — 16 compases
Pre-coro — 4 compases
Coro — 8 compases
Break instrumental — 8 compases
Puente — 8 compases
Coro final — 16 compases
Outro — 4 compases
Total diseñado: 104 compases.
Si 104 compases de 4/4 fueran ejecutados estrictamente a 88 BPM, su duración matemática sería aproximadamente:
4 minutos y 44 segundos.
Eso nos proporcionaba una referencia temporal teórica.
Pero hay que establecer inmediatamente una diferencia importante:
diseñar 104 compases no demuestra que un motor generativo haya ejecutado exactamente los 104 compases.
Para afirmar eso tendríamos que analizar posteriormente los audios y contar su estructura real.
Por ahora, sabemos lo que diseñamos.
Veamos qué observamos.
8. Primera prueba: OpenMusic V2.5
El diseño fue entregado a OpenMusic V2.5.
Obtuvimos dos generaciones:
Generación 1 — 4:15
Generación 2 — 4:29
Las dos fueron escuchadas completamente y evaluadas por Irving García Velázquez.
Resultado:
✅ 2 de 2 satisfactorias.
Durante la evaluación auditiva se observaron:
pronunciación clara;
fraseo cómodo;
ausencia percibida de palabras atropelladas;
espacios instrumentales naturales;
integración satisfactoria de la letra;
comportamiento vocal coherente con el Rap solicitado.
Además ocurrió algo interesante.
La interpretación introdujo pequeños recursos vocales como “uh, uh” en espacios disponibles.
T.F.A.M. nunca ordenó específicamente esos ad-libs.
Por eso este detalle nos ayudó a comprender mejor qué estábamos buscando.
No queremos eliminar la creatividad generativa.
Queremos reducir la necesidad de que el motor improvise decisiones estructurales que nosotros podemos tomar antes.
Podemos resumirlo así:
Estructura controlada. Interpretación flexible.
9. Segunda prueba: Suno v4.5-all
Entonces decidimos hacer algo especialmente importante:
cambiar de motor.
La misma lógica estructural fue llevada a Suno v4.5-all.
Nuevamente obtuvimos dos generaciones:
Generación 1 — 4:23
Generación 2 — 4:51
Ambas fueron escuchadas completamente.
Resultado:
✅ 2 de 2 satisfactorias.
En esta prueba tampoco se percibió el enredo de palabras que habíamos encontrado anteriormente en determinadas generaciones extensas o densas.
La letra resultó inteligible y musicalmente integrada.
Y entonces teníamos algo que ya merecía ser documentado.
10. Cuatro generaciones, dos motores
El resultado inicial quedó así:
OpenMusic V2.5
2 generaciones → 2 satisfactorias.
Suno v4.5-all
2 generaciones → 2 satisfactorias.
TOTAL
4 generaciones
2 motores diferentes
4 evaluaciones satisfactorias
Además, las duraciones quedaron dentro de un territorio relativamente próximo a nuestra referencia teórica de aproximadamente 4:44:
4:15
4:29
4:23
4:51
Esto es interesante.
Pero debemos tener cuidado con lo que significa.
La proximidad temporal no demuestra que cada motor respetara matemáticamente cada bloque solicitado.
Tampoco demuestra que T.F.A.M. vaya a producir siempre canciones de duración semejante.
Sí constituye una primera señal experimental suficientemente interesante para continuar probando el sistema.
11. ¿La IA dejó de improvisar?
No exactamente.
Y no queremos que lo haga completamente.
Una IA musical todavía puede tomar decisiones interpretativas relacionadas con:
melodías;
articulaciones;
fills;
ad-libs;
transiciones;
dinámicas;
variaciones instrumentales.
La diferencia que estamos intentando introducir es otra:
Reducir el territorio donde el motor necesita improvisar estructuralmente y conservar libertad donde la interpretación puede aportar musicalidad.
Antes podíamos entregarle una montaña de información y esperar que encontrara el camino.
Ahora intentamos hacer algo diferente:
No le dimos la montaña a la IA. Diseñamos el camino antes de generar.
12. ¿Resolvimos los errores de pronunciación?
❌ No.
Cuatro canciones no pueden demostrar eso.
Los motores generativos continúan teniendo variabilidad y limitaciones.
Lo que este experimento sí hace es desafiar una suposición:
que todo problema de fraseo o pronunciación debe atribuirse automáticamente al generador.
Nuestra nueva hipótesis es:
Parte de algunos problemas atribuidos exclusivamente al motor generativo podría estar relacionada también con la densidad, arquitectura y organización temporal de la información musical que recibe.
Una letra excesivamente densa puede obligar al sistema a comprimir palabras.
Una arquitectura poco definida puede dejar demasiadas decisiones abiertas simultáneamente.
Una composición mejor dimensionada podría reducir parte de esa presión.
Eso todavía es una hipótesis.
Pero cuatro resultados satisfactorios consecutivos distribuidos entre dos motores diferentes nos parecen una razón suficiente para seguir investigándola.
13. Lo que diseñamos, lo que observamos y lo que falta demostrar
Esta separación es fundamental.
🧬 DISEÑAMOS
Una composición basada en:
4/4;
88 BPM;
Boom Bap;
104 compases planificados;
bloques explícitos;
letra reducida y distribuida;
espacios instrumentales;
instrumentación limitada;
jerarquía clara;
arquitectura previa a la generación.
👀 OBSERVAMOS
Cuatro generaciones satisfactorias según evaluación humana inicial.
Las cuatro presentaron una duración relativamente cercana al territorio temporal diseñado.
En la escucha no se percibieron los problemas graves de compresión verbal que motivaron parte de esta investigación.
El comportamiento apareció en dos motores diferentes.
🔬 TODAVÍA QUEREMOS COMPROBAR
Si los motores respetaron realmente los bloques solicitados.
Qué variable produjo mayor efecto.
Si el resultado se repite en nuevas generaciones.
Qué ocurre al eliminar los bloques manteniendo iguales las demás variables.
Cómo responde el método a otros BPM.
Cómo se comporta en otros géneros.
Qué sucede en Salsa, Rock, Metal, Worship u otras arquitecturas.
Qué parte de la mejora corresponde a la reducción de letra y qué parte a la estructura temporal.
Y, sobre todo:
dónde deja de funcionar.
Porque encontrar los límites de un método también forma parte de comprenderlo.
14. T.F.A.M. no convierte todos los géneros en lo mismo
Que Rap, Salsa y Rock puedan utilizar 4/4 no significa que deban construirse igual.
Un:
Rap 4/4
no camina igual que una:
Salsa 4/4
ni que un:
Heavy Rap Rock 4/4.
Cambian los acentos.
Cambian las síncopas.
Cambia el groove.
Cambia el fraseo.
Cambian las funciones instrumentales.
Puede cambiar incluso la manera más útil de organizar los bloques.
Por eso T.F.A.M. no pretende imponer una plantilla universal.
Pretende hacer una pregunta:
¿Cuál es la arquitectura temporal apropiada para la música que queremos construir?
15. Intuición humana + conocimiento + experimentación
Este descubrimiento tampoco nació de una teoría escrita de antemano.
Nació conversando.
Irving aportó una intuición musical sencilla:
“¿Y el 4x4?”
La conversación permitió separar técnicamente compás, tempo y género.
Después apareció la posibilidad de trabajar con bloques.
Irving detectó inmediatamente su importancia.
Investigamos.
Corregimos lo que podía convertirse en una generalización.
Lo llevamos inmediatamente al laboratorio.
Y generamos.
La secuencia terminó siendo:
La intuición detecta.
El conocimiento organiza.
El experimento prueba.
El oído evalúa.
La evidencia documenta.
Eso representa bastante bien cómo entendemos la colaboración entre inteligencia humana e inteligencia artificial dentro de Promt1.
La IA puede ayudar a organizar, calcular, comparar, generar y analizar.
Pero alguien todavía tiene que escuchar.
Alguien tiene que decidir.
Alguien tiene que decir:
esto funciona; esto no.
16. Una nueva manera de entender el prompt musical
Quizás el aprendizaje más importante de este experimento sea que comenzamos a dejar de pensar el prompt musical únicamente como una descripción.
No solamente:
“Christian Boom Bap, 88 BPM, piano, bajo y batería.”
Podemos comenzar mucho antes.
¿Qué queremos comunicar?
¿En qué compás?
¿A qué velocidad?
¿Cómo camina ese género?
¿Cuánto espacio necesita un verso?
¿Cuánto necesita el coro?
¿Cuándo debe callar la voz?
¿Cuándo deben hablar los instrumentos?
¿Cuánta letra cabe razonablemente?
¿Cómo debe crecer la energía?
¿Qué instrumento sostiene la base?
¿Qué elementos son solamente decoración?
Entonces, finalmente, escribimos el prompt.
Por eso este experimento nos deja una frase que probablemente permanecerá dentro de nuestro sistema de trabajo:
Un prompt musical completo no comienza cuando escribimos el prompt. Comienza cuando tomamos correctamente las decisiones musicales que el prompt tendrá que comunicar.
17. Conclusión
T.F.A.M. se encuentra en una primera fase experimental.
No hemos demostrado una fórmula universal.
No hemos eliminado los errores de las inteligencias artificiales musicales.
No sabemos todavía cuánto de los resultados observados corresponde específicamente a cada variable.
Lo que sí tenemos es algo concreto:
una arquitectura diseñada conscientemente, cuatro generaciones satisfactorias y un comportamiento observado inicialmente en dos motores diferentes.
Eso es suficiente para continuar.
El próximo paso no será declarar victoria.
Será volver al laboratorio.
Cambiar variables.
Comparar.
Escuchar.
Medir cuando sea útil.
Conservar lo bueno.
Descartar lo innecesario.
Y documentar lo que realmente ocurra.
Porque quizá la pregunta ya no sea solamente:
¿Cómo escribimos mejores prompts para generar música?
Quizá debamos comenzar preguntando:
¿Cómo diseñamos mejor la música antes de pedirle a una inteligencia artificial que la interprete?
🧬📦🎹🥁🎤
Promt1Oficial
Irving García Velázquez | Puerto Rico 🇵🇷
Música Cristiana | IA Emocional | Fe, Música y Tecnología
Caso experimental: Dios es Dominio Total
Métodos: Prompt en Caja 📦 + T.F.A.M. 🧬
Motores probados: OpenMusic V2.5 + Suno v4.5-all
Resultado inicial: 4 generaciones / 4 evaluaciones satisfactorias.
La tecnología ayuda a producir y estudiar la obra. El criterio humano continúa decidiendo qué conservar.
A Dios sea la gloria. 🙏🏼
Firmas:
Irving García Velázquez | Promt1Oficial
ReynaAbeja5.0 🐝 | IvoReynaAbeja5.0 🧬
Fe • Música • Tecnología | Puerto Rico 🇵🇷
Hashtags:







Comentarios